Öppna PDF till XML för att exportera sidposter, textblock och ritdata. Vår fyrsidiga PDF skapar document.xml plus en refererad PNG-bild inuti ZIP-filen.
Välj PDF-sidorna
Ladda PDF-filen och lämna Sidor tomt för hela dokumentet, eller ange det delområde du behöver. Vårt exempel inkluderar alla fyra sidor.
Exportera och håll tillgångarna samlade
Välj Start. En export med bildtillgångar laddas ner som ZIP. Extrahera hela arkivet och behåll images-katalogen bredvid document.xml.
Exemplet inkluderar images/page-001-image-005.png. Bildreferenser pekar på tillgångssökvägar istället för att bädda in binär data i XML-filen. En export utan bildtillgångar kan laddas ner direkt som .xml.
Läs dokumentstrukturen
Exemplet deklarerar version 1, enheter pt och ett top-left-origo. Sidposter inkluderar källsidnummer, mått, rotation, block och ritningar. Koordinater beskriver den oroterade sidan; ta hänsyn till rotation när du lägger över datan.
Tolka XML-filen med en XML-parser. Upprepade värden använder item-element; vissa geometriska tupler är textvärden. Inspektera den faktiska strukturen istället för att anta ett publiceringsschema som DocBook.
Kontrollera läsordning och bildreferenser mot den ursprungliga PDF-filen innan du använder datan i ditt arbetsflöde.
Vanliga frågor
Innehåller XML-filen semantiska kapitel?
Det beskriver extraherad siddata. Rubrikbetydelse, läsordning och dokumentsemantik kan behöva din egen tolkning.
Varför fick jag en ZIP-fil?
Exemplet innehåller en bild. ZIP-filen håller document.xml och den refererade tillgången samlade så att bilden kan hittas.
Prova med ditt dokument
Granska resultatet och spara sedan den version du behöver.

