Öffnen Sie PDF zu XML, um Seitendatensätze, Textblöcke und Zeichnungsdaten zu exportieren. Unser vierseitiges PDF erzeugt document.xml sowie ein referenziertes PNG-Bild innerhalb einer ZIP-Datei.
Wählen Sie die PDF-Seiten
Laden Sie das PDF und lassen Sie Seiten für das gesamte Dokument leer oder geben Sie den gewünschten Teilbereich ein. Unser Beispiel umfasst alle vier Seiten.
Exportieren und Assets zusammenhalten
Wählen Sie Start. Ein Export mit Bild-Assets wird als ZIP heruntergeladen. Entpacken Sie das gesamte Archiv und bewahren Sie das Verzeichnis images neben document.xml auf.
Das Beispiel enthält images/page-001-image-005.png. Bildreferenzen verweisen auf Asset-Pfade, anstatt Binärdaten in das XML einzubetten. Ein Export ohne Bild-Assets kann direkt als .xml heruntergeladen werden.
Lesen Sie die Dokumentstruktur
Das Beispiel deklariert Version 1, Einheiten pt und einen oben-links Ursprung. Seitendatensätze enthalten die Quellseitennummer, Dimensionen, Drehung, Blöcke und Zeichnungen. Koordinaten beschreiben die ungedrehte Seite; berücksichtigen Sie die Drehung beim Überlagern der Daten.
Parsen Sie das XML mit einem XML-Parser. Wiederholte Werte verwenden Item-Elemente; einige geometrische Tupel sind Textwerte. Prüfen Sie die tatsächliche Struktur, anstatt ein Publikationsschema wie DocBook vorauszusetzen.
Überprüfen Sie die Leserichtung und Bildreferenzen anhand des ursprünglichen PDFs, bevor Sie die Daten in Ihrem Verarbeitungsworkflow verwenden.
Häufige Fragen
Enthält das XML semantische Kapitel?
Es beschreibt extrahierte Seitendaten. Die Bedeutung von Überschriften, die Leserichtung und die Dokumentsemantik erfordern möglicherweise Ihre eigene Interpretation.
Warum habe ich eine ZIP-Datei erhalten?
Das Beispiel enthält ein Bild. Die ZIP-Datei hält document.xml und das referenzierte Asset zusammen, damit das Bild lokalisiert werden kann.
Probieren Sie es mit Ihrem Dokument aus
Überprüfen Sie das Ergebnis und speichern Sie dann die Version, die Sie benötigen.

