Nástroje150

PRAKTICKÝ SPRIEVODCA PDF

Ako previesť PDF do XML s údajmi o rozložení

Získajte štruktúrované údaje o stránkach pre svoj vlastný pracovný postup.

Exportujte text z PDF, rozmery strán a údaje o kresbách do formátu XML. Ponechajte referencované obrázky pohromade a pred použitím v kóde skontrolujte štruktúru.

Postupujte podľa príručky
PRÍKLAD REÁLNEHO NÁSTROJA
PredPrvá strana štvorstranového zdrojového PDF.
  • 4 strán PDF
PoFormátovaný úvodný výňatok skutočného exportu document.xml.
  • document.xml · 4 záznamov strán
  • 1 referencovaný PNG prvok
Výsledkom sú štruktúrované údaje XML, zobrazené ako výňatok. Kompletný export obsahuje všetky štyri strany a referencovaný obrázkový prvok.
Advertisements
RÝCHLY VIDEO NÁVOD Ako previesť PDF do XML s údajmi o rozložení Získajte štruktúrované údaje o stránkach pre svoj vlastný pracovný postup. Anglický komentár Pozrieť video

Ako previesť PDF do XML s údajmi o rozložení

Advertisements

Otvorte PDF do XML pre export záznamov strán, textových blokov a údajov o kresbách. Naše štvorstranové PDF vytvorí document.xml plus jeden referencovaný PNG obrázok v rámci ZIP.

01

Vyberte strany PDF

Nahrajte PDF a nechajte Strany prázdne pre celý dokument, alebo zadajte podmnožinu, ktorú potrebujete. Náš príklad obsahuje všetky štyri strany.

02

Exportujte a ponechajte prvky pohromade

Zvoľte Štart. Export s obrázkovými prvkami sa stiahne ako ZIP. Rozbaľte celý archív a ponechajte adresár images vedľa document.xml.

Ukážka obsahuje images/page-001-image-005.png. Referencie na obrázky ukazujú na cesty k prvkom namiesto vkladania binárnych údajov do XML. Export bez obrázkových prvkov sa môže stiahnuť priamo ako .xml.

03

Prečítajte štruktúru dokumentu

Ukážka deklaruje verziu 1, jednotky pt a počiatok vľavo hore. Záznamy strán obsahujú číslo zdrojovej strany, rozmery, rotáciu, bloky a kresby. Súradnice opisujú neotočenú stranu; pri prekrývaní údajov zohľadnite rotáciu.

Analyzujte XML pomocou XML parsera. Opakované hodnoty používajú prvky položiek; niektoré geometrické n-tice sú textové hodnoty. Skontrolujte skutočnú štruktúru namiesto predpokladania publikačnej schémy, ako je DocBook.

Pred použitím údajov vo vašom pracovnom postupe skontrolujte poradie čítania a referencie na obrázky oproti pôvodnému PDF.

NIEKOĽKO UŽITOČNÝCH DETAILOV

Časté otázky

Obsahuje XML sémantické kapitoly?

Opisuje extrahované údaje stránky. Význam nadpisov, poradie čítania a sémantika dokumentu môžu vyžadovať vašu vlastnú interpretáciu.

Prečo som dostal ZIP?

Ukážka obsahuje obrázok. ZIP udržiava document.xml a referencovaný prvok pohromade, aby bolo možné obrázok lokalizovať.

STE NA RADE

Vyskúšajte to so svojím dokumentom

Skontrolujte výsledok a potom uložte verziu, ktorú potrebujete.

Otvoriť PDF do XML

Detail obrázka

Advertisements

Jazyk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina