Fodr en JSON-behandlingsproces
Eksporter sideindhold som JSON til et script eller en applikation, der forstår den dokumenterede outputstruktur.
Eksporter PDF-tekst, billeder og tegningsgeometri som JSON.
Brug sidekontrollerne til at inspicere dit dokument.
Download dit resultat, eller vend tilbage til indstillingerne for at lave en anden version.
Upload én PDF fra din enhed.
Gennemgå de tilgængelige indstillinger, og start derefter behandlingen.
Gem resultatet og tjek det, før du deler det.
Eksporter PDF-tekst, billeder og tegningsgeometri som JSON. Vælg sider og download en struktureret beskrivelse, med billedaktiver pakket sammen med den, når det er nødvendigt.
Eksporter sideindhold som JSON til et script eller en applikation, der forstår den dokumenterede outputstruktur.
Brug indholdskoordinater til at studere sidelayout; de refererer til den u-roterede PDF-side frem for browser-pixels.
Gennemgå udtrukne objekter, før du opbygger dokumentspecifikke parser-regler. Scanninger kræver OCR for genkendt tekst.
Hent en struktureret beskrivelse af sideindholdet i stedet for en almindelig udskrift.
Den versionsopdelte struktur inkluderer sider, tekstblokke og -spænd, skrifttyper, afgrænsningsrammer og vektortegningsstier. Koordinater er i PDF-punkter fra den uroterede sides øverste venstre hjørne; rotation registreres separat. Dette kan understøtte indeksering eller dokumentanalyse, men konverteren udleder ikke dit eget forretningsskema eller semantiske feltnavne.
Modtag en direkte datafil eller en ZIP-fil, når udtrukne billeder er inkluderet.
Når en side indeholder billeddata, indeholder arkivet document.json eller document.xml plus refererede billedfiler og eventuelle understøttede masker. Hold disse stier samlet, når dataene indlæses andre steder. En scanning, der kun består af billeder, forbliver billeddata; denne eksport udfører ikke OCR for at opfinde manglende tekstspænd.
Behandl hele dokumentet eller indtast specifikke sidenumre og intervaller.
Brug PDF-positioner, startende ved 1, frem for numre trykt på siden. En liste som 1, 3-5 inkluderer fire sider. Et tomt interval bruger alle sider. Tjek forhåndsvisningen, når dokumentet indeholder et omslag eller kapitler med forskellig nummerering. Kun de valgte sider inkluderes i denne konvertering.
Tekstudtrækning læser et tekstlag; den genkender ikke bogstaver i billeder.
Udtrækning bruger et eksisterende tekstlag og genkender ikke bogstaver i sidebilleder. Hvis en side ikke har læsbar tekst, skal du bruge PDF OCR separat. En blank side kan også resultere i ingen tekst. For blandede PDF'er skal du inspicere tomme eller ulæselige sider individuelt. OCR behandler én valgt side ad gangen.
Åbn én PDF på op til 100 MB og 750 kildesider. Beskyttede filer kræver en ulåst kopi, medmindre dette værktøj eksplicit tilbyder adgangskodeindtastning. Store eller komplekse sider kan kræve mere hukommelse eller nå behandlingsgrænser, selv når filen er inden for disse grænser.
Behandlingen bruger vores servere. Kildefiler, midlertidige filer og resultater slettes fra vores servere inden for 30 minutter efter, at behandlingen er afsluttet. Vi deler ikke dokumentindhold med tredjeparter eller bruger det til at træne AI-modeller.
Vid hvad du kan forvente, før du starter.
Midlertidig serverbehandlingDen eksporterer sideindhold og geometri, ikke automatisk navngivne forretningsfelter. Din applikation skal fortolke den struktur. Til tabelceller, brug Udtræk tabeller fra PDF; til scanninger, brug PDF OCR.
Den versionsstyrede struktur inkluderer sider, tekstblokke og spans, skrifttyper, afgrænsningsrammer og vektortegningsstier. Koordinater er i PDF-punkter fra den uroterede sides øverste venstre oprindelse; rotation registreres separat. Dette kan understøtte indeksering eller dokumentanalyse, men konverteren udleder ikke din egen forretningsmodel eller semantiske feltnavne.
Når en side indeholder billeddata, indeholder arkivet document.json eller document.xml plus refererede billedfiler og eventuelle understøttede masker. Hold disse stier samlet, når du indlæser dataene et andet sted. En scanning, der kun består af billeder, forbliver billeddata; denne eksport udfører ikke OCR for at opfinde manglende tekstspans.
Udtrakningen bruger et eksisterende tekstlag og genkender ikke bogstaver i sidebilleder. Hvis en side ikke har læsbar tekst, skal du bruge PDF OCR separat. En blank side kan også resultere i ingen tekst. For blandede PDF-filer skal du inspicere tomme eller ulæselige sider individuelt. OCR behandler én valgt side ad gangen.
Åbn én PDF på op til 100 MB og 750 kildesider. Beskyttede filer kræver en ulåst kopi, medmindre dette værktøj eksplicit tilbyder adgangskodeindtastning. Store eller komplekse sider kan kræve mere hukommelse eller nå behandlingsgrænser, selv når filen er inden for disse grænser.
Dette værktøj bruger vores servere til behandling. Din originale fil bliver ikke overskrevet; resultatet er en separat download. Se og gennemgå resultatet, hvor det er muligt, og download den kopi, du har brug for, før du starter forfra.
HURTIG VIDEO-VEJLEDNING
Sådan konverterer du PDF til JSON med layoutdata
Få strukturerede sidedata til din egen arbejdsgang.
Engelsk fortællerstemme
Se videoen