Verktyg150

EN PRAKTISK PDF-GUIDE

Så här konverterar du PDF till XML med layoutdata

Få strukturerad siddata för ditt eget arbetsflöde.

Exportera PDF-text, sidmått och ritdata som XML. Håll refererade bilder samlade och inspektera strukturen innan du använder den i kod.

Följ guiden
ETT VERKLIGT VERKTYGSEXEMPEL
FöreFörsta sidan av den fyrsidiga PDF-källan.
  • 4 PDF-sidor
EfterSnyggt formaterat inledande utdrag av den faktiska document.xml-exporten.
  • document.xml · 4 sidposter
  • 1 refererad PNG-tillgång
Resultatet är strukturerad XML-data, visad som ett utdrag. Den fullständiga exporten inkluderar alla fyra sidor och den refererade bildtillgången.
Advertisements
SNABB VIDEO-TUTORIAL Så här konverterar du PDF till XML med layoutdata Få strukturerad siddata för ditt eget arbetsflöde. Engelsk berättarröst Se videon

Så här konverterar du PDF till XML med layoutdata

Advertisements

Öppna PDF till XML för att exportera sidposter, textblock och ritdata. Vår fyrsidiga PDF skapar document.xml plus en refererad PNG-bild inuti ZIP-filen.

01

Välj PDF-sidorna

Ladda PDF-filen och lämna Sidor tomt för hela dokumentet, eller ange det delområde du behöver. Vårt exempel inkluderar alla fyra sidor.

02

Exportera och håll tillgångarna samlade

Välj Start. En export med bildtillgångar laddas ner som ZIP. Extrahera hela arkivet och behåll images-katalogen bredvid document.xml.

Exemplet inkluderar images/page-001-image-005.png. Bildreferenser pekar på tillgångssökvägar istället för att bädda in binär data i XML-filen. En export utan bildtillgångar kan laddas ner direkt som .xml.

03

Läs dokumentstrukturen

Exemplet deklarerar version 1, enheter pt och ett top-left-origo. Sidposter inkluderar källsidnummer, mått, rotation, block och ritningar. Koordinater beskriver den oroterade sidan; ta hänsyn till rotation när du lägger över datan.

Tolka XML-filen med en XML-parser. Upprepade värden använder item-element; vissa geometriska tupler är textvärden. Inspektera den faktiska strukturen istället för att anta ett publiceringsschema som DocBook.

Kontrollera läsordning och bildreferenser mot den ursprungliga PDF-filen innan du använder datan i ditt arbetsflöde.

NÅGRA ANVÄNDBARA DETALJER

Vanliga frågor

Innehåller XML-filen semantiska kapitel?

Det beskriver extraherad siddata. Rubrikbetydelse, läsordning och dokumentsemantik kan behöva din egen tolkning.

Varför fick jag en ZIP-fil?

Exemplet innehåller en bild. ZIP-filen håller document.xml och den refererade tillgången samlade så att bilden kan hittas.

DIN TUR

Prova med ditt dokument

Granska resultatet och spara sedan den version du behöver.

Öppna PDF till XML

Bilddetalj

Advertisements

Språk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina