Open PDF naar XML om paginarecords, tekstblokken en tekengegevens te exporteren. Onze PDF van vier pagina's produceert document.xml plus één verwezen PNG-afbeelding in een ZIP-bestand.
Kies de PDF-pagina's
Laad de PDF en laat Pagina's leeg voor het hele document, of voer de subset in die je nodig hebt. Ons voorbeeld bevat alle vier de pagina's.
Exporteer en houd de bestanden bij elkaar
Kies Start. Een export met afbeeldingsbestanden wordt gedownload als ZIP. Pak het hele archief uit en houd de map images naast document.xml.
Het voorbeeld bevat images/page-001-image-005.png. Afbeeldingsverwijzingen wijzen naar bestandspaden in plaats van binaire gegevens in de XML in te sluiten. Een export zonder afbeeldingsbestanden kan direct als .xml worden gedownload.
Lees de documentstructuur
Het voorbeeld declareert versie 1, eenheden pt en een top-left oorsprong. Paginarecords bevatten het bronpaginanummer, afmetingen, rotatie, blokken en tekeningen. Coördinaten beschrijven de niet-geroteerde pagina; houd rekening met rotatie bij het overlappen van de gegevens.
Parse de XML met een XML-parser. Herhaalde waarden gebruiken item-elementen; sommige geometrische tupels zijn tekstwaarden. Inspecteer de werkelijke structuur in plaats van uit te gaan van een publicatieschema zoals DocBook.
Controleer de leesvolgorde en afbeeldingsverwijzingen tegen de originele PDF voordat je de gegevens in je verwerkingsworkflow gebruikt.
Veelgestelde vragen
Bevat de XML semantische hoofdstukken?
Het beschrijft geëxtraheerde paginagegevens. De betekenis van koppen, leesvolgorde en documentsemantiek vereisen mogelijk je eigen interpretatie.
Waarom heb ik een ZIP ontvangen?
Het voorbeeld bevat een afbeelding. ZIP houdt document.xml en het verwezen bestand bij elkaar zodat de afbeelding kan worden gevonden.
Probeer het met jouw document
Controleer het resultaat en sla vervolgens de versie op die je nodig hebt.

