Åbn PDF til XML for at eksportere sideposter, tekstblokke og tegnedata. Vores PDF på fire sider producerer document.xml plus ét refereret PNG-billede inde i en ZIP-fil.
Vælg PDF-siderne
Indlæs PDF'en og lad Sider stå tom for hele dokumentet, eller indtast det undersæt, du har brug for. Vores eksempel inkluderer alle fire sider.
Eksportér og hold aktiverne samlet
Vælg Start. En eksport med billedaktiver downloades som ZIP. Udpak hele arkivet og behold images-mappen ved siden af document.xml.
Eksemplet inkluderer images/page-001-image-005.png. Billedreferencer peger på aktivstier i stedet for at indlejre binære data i XML'en. En eksport uden billedaktiver kan downloades direkte som .xml.
Læs dokumentstrukturen
Eksemplet erklærer version 1, enheder pt og en top-venstre oprindelse. Sideposter inkluderer kildesidenummer, dimensioner, rotation, blokke og tegninger. Koordinater beskriver den uroterede side; tag højde for rotation, når du lægger dataene ovenpå.
Parse XML'en med en XML-parser. Gentagne værdier bruger item-elementer; nogle geometriske tupler er tekstværdier. Inspicér den faktiske struktur i stedet for at antage et publiceringsskema som f.eks. DocBook.
Tjek læserækkefølge og billedreferencer mod den originale PDF, før du bruger dataene i din arbejdsgang.
Almindelige spørgsmål
Indeholder XML'en semantiske kapitler?
Det beskriver udtrukne sidedata. Overskriftsbetydning, læserækkefølge og dokumentsemantik kan kræve din egen fortolkning.
Hvorfor modtog jeg en ZIP-fil?
Eksemplet indeholder et billede. ZIP-filen holder document.xml og det refererede aktiv samlet, så billedet kan findes.
Prøv det med dit dokument
Gennemse resultatet, og gem derefter den version, du har brug for.

