Napajanje poteka dela obdelave JSON
Izvozite vsebino strani kot JSON za skript ali aplikacijo, ki razume dokumentirano izhodno strukturo.
Izvozi besedilo, slike in geometrijo risanja PDF v JSON.
Uporabite kontrole strani za pregled dokumenta.
Prenesite svoj rezultat ali se vrnite na nastavitve, da ustvarite drugo različico.
Naložite en PDF iz svoje naprave.
Preglejte razpoložljive nastavitve in nato začnite obdelavo.
Shranite rezultat in ga preverite, preden ga delite.
Izvozite besedilo, slike in geometrijo risanja PDF v JSON. Izberite strani in prenesite strukturiran opis, po potrebi s priloženimi slikovnimi sredstvi.
Izvozite vsebino strani kot JSON za skript ali aplikacijo, ki razume dokumentirano izhodno strukturo.
Uporabite koordinate vsebine za preučevanje postavitve strani; nanašajo se na neobrnjen PDF, ne na slikovne pike brskalnika.
Preglejte ekstrahirane objekte pred izdelavo pravil razčlenjevanja za določen dokument. Skenirani dokumenti potrebujejo OCR za prepoznano besedilo.
Pridobite strukturiran opis vsebine strani namesto preprostega prepisa.
Različična struktura vključuje strani, besedilne bloke in razpone, pisave, mejne okvire in vektorske risalne poti. Koordinate so v točkah PDF od zgornjega levega izvora neobrnjenene strani; rotacija je zabeležena ločeno. To lahko podpira indeksiranje ali analizo dokumentov, vendar pretvornik ne sklepa o vaši lastni poslovni shemi ali semantičnih imenih polj.
Prejmite neposredno podatkovno datoteko ali ZIP, ko so vključene ekstrahirane slike.
Ko stran vsebuje slikovne podatke, arhiv vsebuje document.json ali document.xml ter referenčne slikovne datoteke in vse podprte maske. Te poti hranite skupaj, ko podatke nalagate drugam. Skeniranje samo s slikami ostane slikovni podatek; ta izvoz ne izvaja OCR za izmišljanje manjkajočih besedilnih razponov.
Obdelajte celoten dokument ali vnesite določene številke strani in razpone.
Uporabite položaje v PDF-ju, začenši z 1, namesto številk, natisnjenih na strani. Seznam, kot je 1, 3-5, vključuje štiri strani. Prazen razpon uporabi vse strani. Preverite predogled, ko dokument vključuje naslovnico ali drugače oštevilčena poglavja. V to pretvorbo so vključene samo izbrane strani.
Izvleček besedila bere besedilno plast; ne prepoznava črk v slikah.
Izvleček uporablja obstoječo besedilno plast in ne prepoznava črk v slikah strani. Če stran nima berljivega besedila, uporabite PDF OCR ločeno. Prazna stran prav tako morda ne bo dala besedila. Pri mešanih PDF-jih preglejte prazne ali neberljive strani posamično. OCR obdela eno izbrano stran naenkrat.
Odprite en PDF do 100 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.
Obdelava uporablja naše strežnike. Izvorne datoteke, začasne datoteke in rezultati se izbrišejo z naših strežnikov v 30 minutah po končani obdelavi. Vsebine dokumentov ne delimo s tretjimi osebami in jih ne uporabljamo za usposabljanje modelov umetne inteligence.
Vedite, kaj pričakovati, preden začnete.
Začasna obdelava na strežnikuIzvozi vsebino strani in geometrijo, ne pa samodejno poimenovanih poslovnih polj. Vaša aplikacija mora interpretirati to strukturo. Za celice tabel uporabite Ekstrahiraj tabele iz PDF; za skenirane dokumente uporabite PDF OCR.
Različična struktura vključuje strani, besedilne bloke in razpone, pisave, omejitvene okvirje in poti vektorskih risb. Koordinate so v točkah PDF od zgornjega levega izvora neobrnjen strani; rotacija je zabeležena ločeno. To lahko podpira indeksiranje ali analizo dokumentov, vendar pretvornik ne sklepa o vaši lastni poslovni shemi ali semantičnih imenih polj.
Ko stran vsebuje slikovne podatke, arhiv vsebuje document.json ali document.xml ter referenčne slikovne datoteke in vse podprte maske. Pri nalaganju podatkov drugam hranite te poti skupaj. Skeniranje, ki vsebuje samo slike, ostane slikovni podatek; ta izvoz ne izvaja OCR za izmišljanje manjkajočih besedilnih razponov.
Pridobivanje uporablja obstoječo besedilno plast in ne prepoznava črk na slikah strani. Če stran nima berljivega besedila, uporabite ločeno orodje PDF OCR. Prazna stran prav tako morda ne bo ustvarila besedila. Pri mešanih datotekah PDF preglejte prazne ali neberljive strani posamično. Postopek OCR obdela eno izbrano stran naenkrat.
Odprite en PDF do 100 MB in 750 izvornih strani. Zaščitene datoteke potrebujejo odklenjeno kopijo, razen če to orodje izrecno ponuja vnos gesla. Velike ali zapletene strani lahko zahtevajo več pomnilnika ali dosežejo omejitve obdelave, tudi če je datoteka znotraj teh omejitev.
To orodje za obdelavo uporablja naše strežnike. Vaša izvirna datoteka ni prepisana; rezultat je ločen prenos. Predogled in pregled rezultatov sta na voljo, kjer je to mogoče, kopijo pa prenesite, preden začnete znova.
HITRA VIDEO VADNICA
Kako pretvoriti PDF v JSON s podatki o postavitvi
Pridobite strukturirane podatke strani za svoj potek dela.
Angleška pripoved
Oglejte si video