Værktøjer150

En nyttig PDF-opgave, gjort enkel

PDF til JSON.

Eksporter PDF-tekst, billeder og tegningsgeometri som JSON.

Advertisements
Dit PDF-arbejdsområde
Midlertidig serverbehandling
eller slip dine filer her
Sendes til midlertidig behandling, når du starter. PDF
Advertisements

Sådan konverterer du PDF til JSON

  1. 01

    Vælg dit dokument

    Upload én PDF fra din enhed.

  2. 02

    Opsæt resultatet

    Gennemgå de tilgængelige indstillinger, og start derefter behandlingen.

  3. 03

    Download din fil

    Gem resultatet og tjek det, før du deler det.

BlogSådan konverterer du PDF til JSON med layoutdataLæs guiden

PDF til JSON

Eksporter PDF-tekst, billeder og tegningsgeometri som JSON. Vælg sider og download en struktureret beskrivelse, med billedaktiver pakket sammen med den, når det er nødvendigt.

Hold kildestrukturen synlig
HURTIG VIDEO-VEJLEDNING Sådan konverterer du PDF til JSON med layoutdata Få strukturerede sidedata til din egen arbejdsgang. Engelsk fortællerstemme Se videoen

Sådan konverterer du PDF til JSON med layoutdata

Praktiske måder at bruge dette værktøj på

Udviklere

Fodr en JSON-behandlingsproces

Eksporter sideindhold som JSON til et script eller en applikation, der forstår den dokumenterede outputstruktur.

Forskere

Inspicer tekstpositioner

Brug indholdskoordinater til at studere sidelayout; de refererer til den u-roterede PDF-side frem for browser-pixels.

Teknisk gennemgang

Adskil udtrækning fra fortolkning

Gennemgå udtrukne objekter, før du opbygger dokumentspecifikke parser-regler. Scanninger kræver OCR for genkendt tekst.

Funktioner og kontroller

Eksporter tekst og tegningsgeometri

Hent en struktureret beskrivelse af sideindholdet i stedet for en almindelig udskrift.

Skema, koordinater og siderotation

Den versionsopdelte struktur inkluderer sider, tekstblokke og -spænd, skrifttyper, afgrænsningsrammer og vektortegningsstier. Koordinater er i PDF-punkter fra den uroterede sides øverste venstre hjørne; rotation registreres separat. Dette kan understøtte indeksering eller dokumentanalyse, men konverteren udleder ikke dit eget forretningsskema eller semantiske feltnavne.

Behold billedaktiver ved siden af dataene

Modtag en direkte datafil eller en ZIP-fil, når udtrukne billeder er inkluderet.

Datafil og refererede billeder

Når en side indeholder billeddata, indeholder arkivet document.json eller document.xml plus refererede billedfiler og eventuelle understøttede masker. Hold disse stier samlet, når dataene indlæses andre steder. En scanning, der kun består af billeder, forbliver billeddata; denne eksport udfører ikke OCR for at opfinde manglende tekstspænd.

Vælg de sider, du har brug for

Behandl hele dokumentet eller indtast specifikke sidenumre og intervaller.

Sideintervaller og nummerering

Brug PDF-positioner, startende ved 1, frem for numre trykt på siden. En liste som 1, 3-5 inkluderer fire sider. Et tomt interval bruger alle sider. Tjek forhåndsvisningen, når dokumentet indeholder et omslag eller kapitler med forskellig nummerering. Kun de valgte sider inkluderes i denne konvertering.

Brug OCR til billed-kun sider

Tekstudtrækning læser et tekstlag; den genkender ikke bogstaver i billeder.

Scanninger, tomme sider og OCR

Udtrækning bruger et eksisterende tekstlag og genkender ikke bogstaver i sidebilleder. Hvis en side ikke har læsbar tekst, skal du bruge PDF OCR separat. En blank side kan også resultere i ingen tekst. For blandede PDF'er skal du inspicere tomme eller ulæselige sider individuelt. OCR behandler én valgt side ad gangen.

Understøttede filer og behandling

Input
PDF
Output
JSON, ZIP

Åbn én PDF på op til 100 MB og 750 kildesider. Beskyttede filer kræver en ulåst kopi, medmindre dette værktøj eksplicit tilbyder adgangskodeindtastning. Store eller komplekse sider kan kræve mere hukommelse eller nå behandlingsgrænser, selv når filen er inden for disse grænser.

Behandlingen bruger vores servere. Kildefiler, midlertidige filer og resultater slettes fra vores servere inden for 30 minutter efter, at behandlingen er afsluttet. Vi deler ikke dokumentindhold med tredjeparter eller bruger det til at træne AI-modeller.

Advertisements
FAQ

Et par nyttige svar

Vid hvad du kan forvente, før du starter.

Midlertidig serverbehandling
Genkender PDF til JSON fakturafelter eller tabelbetydninger?

Den eksporterer sideindhold og geometri, ikke automatisk navngivne forretningsfelter. Din applikation skal fortolke den struktur. Til tabelceller, brug Udtræk tabeller fra PDF; til scanninger, brug PDF OCR.

Hvilke oplysninger indeholder den strukturerede eksport?

Den versionsstyrede struktur inkluderer sider, tekstblokke og spans, skrifttyper, afgrænsningsrammer og vektortegningsstier. Koordinater er i PDF-punkter fra den uroterede sides øverste venstre oprindelse; rotation registreres separat. Dette kan understøtte indeksering eller dokumentanalyse, men konverteren udleder ikke din egen forretningsmodel eller semantiske feltnavne.

Hvorfor indeholder downloadet nogle gange en ZIP-fil?

Når en side indeholder billeddata, indeholder arkivet document.json eller document.xml plus refererede billedfiler og eventuelle understøttede masker. Hold disse stier samlet, når du indlæser dataene et andet sted. En scanning, der kun består af billeder, forbliver billeddata; denne eksport udfører ikke OCR for at opfinde manglende tekstspans.

Vil dette udtrække ord fra en scanning, der kun består af billeder?

Udtrakningen bruger et eksisterende tekstlag og genkender ikke bogstaver i sidebilleder. Hvis en side ikke har læsbar tekst, skal du bruge PDF OCR separat. En blank side kan også resultere i ingen tekst. For blandede PDF-filer skal du inspicere tomme eller ulæselige sider individuelt. OCR behandler én valgt side ad gangen.

Hvad er fil- og sidebegrænsningerne?

Åbn én PDF på op til 100 MB og 750 kildesider. Beskyttede filer kræver en ulåst kopi, medmindre dette værktøj eksplicit tilbyder adgangskodeindtastning. Store eller komplekse sider kan kræve mere hukommelse eller nå behandlingsgrænser, selv når filen er inden for disse grænser.

Hvor bliver mit dokument behandlet?

Dette værktøj bruger vores servere til behandling. Din originale fil bliver ikke overskrevet; resultatet er en separat download. Se og gennemgå resultatet, hvor det er muligt, og download den kopi, du har brug for, før du starter forfra.

Fortsæt

Hvad vil du gøre nu?

Vælg et værktøj. Din færdige PDF følger med dig.

PDF

Advertisements

Sprog38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina