Tools150

EIN PRAKTISCHER PDF-LEITFADEN

So konvertieren Sie PDF in XML mit Layout-Daten

Erhalten Sie strukturierte Seitendaten für Ihren eigenen Workflow.

Exportieren Sie PDF-Text, Seitendimensionen und Zeichnungsdaten als XML. Halten Sie referenzierte Bilder zusammen und prüfen Sie die Struktur, bevor Sie sie im Code verwenden.

Der Anleitung folgen
EIN ECHTES BEISPIEL
VorherErste Seite der vierseitigen PDF-Quelle.
  • 4 PDF-Seiten
NachherSchön formatierter Anfangsauszug des tatsächlichen document.xml-Exports.
  • document.xml · 4 Seitendatensätze
  • 1 referenziertes PNG-Asset
Das Ergebnis sind strukturierte XML-Daten, hier als Auszug dargestellt. Der vollständige Export umfasst alle vier Seiten und das referenzierte Bild-Asset.
Advertisements
KURZE VIDEOANLEITUNG So konvertieren Sie PDF in XML mit Layout-Daten Erhalten Sie strukturierte Seitendaten für Ihren eigenen Workflow. Englische Erzählung Video ansehen

So konvertieren Sie PDF in XML mit Layout-Daten

Advertisements

Öffnen Sie PDF zu XML, um Seitendatensätze, Textblöcke und Zeichnungsdaten zu exportieren. Unser vierseitiges PDF erzeugt document.xml sowie ein referenziertes PNG-Bild innerhalb einer ZIP-Datei.

01

Wählen Sie die PDF-Seiten

Laden Sie das PDF und lassen Sie Seiten für das gesamte Dokument leer oder geben Sie den gewünschten Teilbereich ein. Unser Beispiel umfasst alle vier Seiten.

02

Exportieren und Assets zusammenhalten

Wählen Sie Start. Ein Export mit Bild-Assets wird als ZIP heruntergeladen. Entpacken Sie das gesamte Archiv und bewahren Sie das Verzeichnis images neben document.xml auf.

Das Beispiel enthält images/page-001-image-005.png. Bildreferenzen verweisen auf Asset-Pfade, anstatt Binärdaten in das XML einzubetten. Ein Export ohne Bild-Assets kann direkt als .xml heruntergeladen werden.

03

Lesen Sie die Dokumentstruktur

Das Beispiel deklariert Version 1, Einheiten pt und einen oben-links Ursprung. Seitendatensätze enthalten die Quellseitennummer, Dimensionen, Drehung, Blöcke und Zeichnungen. Koordinaten beschreiben die ungedrehte Seite; berücksichtigen Sie die Drehung beim Überlagern der Daten.

Parsen Sie das XML mit einem XML-Parser. Wiederholte Werte verwenden Item-Elemente; einige geometrische Tupel sind Textwerte. Prüfen Sie die tatsächliche Struktur, anstatt ein Publikationsschema wie DocBook vorauszusetzen.

Überprüfen Sie die Leserichtung und Bildreferenzen anhand des ursprünglichen PDFs, bevor Sie die Daten in Ihrem Verarbeitungsworkflow verwenden.

EINIGE NÜTZLICHE DETAILS

Häufige Fragen

Enthält das XML semantische Kapitel?

Es beschreibt extrahierte Seitendaten. Die Bedeutung von Überschriften, die Leserichtung und die Dokumentsemantik erfordern möglicherweise Ihre eigene Interpretation.

Warum habe ich eine ZIP-Datei erhalten?

Das Beispiel enthält ein Bild. Die ZIP-Datei hält document.xml und das referenzierte Asset zusammen, damit das Bild lokalisiert werden kann.

JETZT SIND SIE DRAN

Probieren Sie es mit Ihrem Dokument aus

Überprüfen Sie das Ergebnis und speichern Sie dann die Version, die Sie benötigen.

PDF zu XML öffnen

Bilddetail

Advertisements

Sprache38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina