Tools150

EEN PRAKTISCHE PDF-GIDS

Hoe converteer je PDF naar XML met lay-outgegevens

Verkrijg gestructureerde paginagegevens voor je eigen workflow.

Exporteer PDF-tekst, pagina-afmetingen en tekengegevens als XML. Houd verwezen afbeeldingen bij elkaar en inspecteer de structuur voordat je deze in code gebruikt.

Volg de handleiding
EEN ECHT VOORBEELD
VoorEerste pagina van de PDF-bron van vier pagina's.
  • 4 PDF-pagina's
NaMooi opgemaakt openingsfragment van de daadwerkelijke document.xml-export.
  • document.xml · 4 paginarecords
  • 1 verwezen PNG-bestand
Het resultaat is gestructureerde XML-data, hier getoond als fragment. De volledige export bevat alle vier de pagina's en het verwezen afbeeldingsbestand.
Advertisements
SNELLE VIDEO-TUTORIAL Hoe converteer je PDF naar XML met lay-outgegevens Verkrijg gestructureerde paginagegevens voor je eigen workflow. Engelse vertelling Bekijk de video

Hoe converteer je PDF naar XML met lay-outgegevens

Advertisements

Open PDF naar XML om paginarecords, tekstblokken en tekengegevens te exporteren. Onze PDF van vier pagina's produceert document.xml plus één verwezen PNG-afbeelding in een ZIP-bestand.

01

Kies de PDF-pagina's

Laad de PDF en laat Pagina's leeg voor het hele document, of voer de subset in die je nodig hebt. Ons voorbeeld bevat alle vier de pagina's.

02

Exporteer en houd de bestanden bij elkaar

Kies Start. Een export met afbeeldingsbestanden wordt gedownload als ZIP. Pak het hele archief uit en houd de map images naast document.xml.

Het voorbeeld bevat images/page-001-image-005.png. Afbeeldingsverwijzingen wijzen naar bestandspaden in plaats van binaire gegevens in de XML in te sluiten. Een export zonder afbeeldingsbestanden kan direct als .xml worden gedownload.

03

Lees de documentstructuur

Het voorbeeld declareert versie 1, eenheden pt en een top-left oorsprong. Paginarecords bevatten het bronpaginanummer, afmetingen, rotatie, blokken en tekeningen. Coördinaten beschrijven de niet-geroteerde pagina; houd rekening met rotatie bij het overlappen van de gegevens.

Parse de XML met een XML-parser. Herhaalde waarden gebruiken item-elementen; sommige geometrische tupels zijn tekstwaarden. Inspecteer de werkelijke structuur in plaats van uit te gaan van een publicatieschema zoals DocBook.

Controleer de leesvolgorde en afbeeldingsverwijzingen tegen de originele PDF voordat je de gegevens in je verwerkingsworkflow gebruikt.

EEN PAAR NUTTIGE DETAILS

Veelgestelde vragen

Bevat de XML semantische hoofdstukken?

Het beschrijft geëxtraheerde paginagegevens. De betekenis van koppen, leesvolgorde en documentsemantiek vereisen mogelijk je eigen interpretatie.

Waarom heb ik een ZIP ontvangen?

Het voorbeeld bevat een afbeelding. ZIP houdt document.xml en het verwezen bestand bij elkaar zodat de afbeelding kan worden gevonden.

JOUW BEURT

Probeer het met jouw document

Controleer het resultaat en sla vervolgens de versie op die je nodig hebt.

Open PDF naar XML

Afbeeldingsdetail

Advertisements

Taal38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina