Nástroje150

PRAKTICKÝ PRŮVODCE PDF

Jak převést PDF do XML s daty o rozvržení

Získejte strukturovaná data stránek pro svůj vlastní pracovní postup.

Exportujte text z PDF, rozměry stránek a data o kresbách do formátu XML. Ponechte odkazované obrázky pohromadě a před použitím v kódu zkontrolujte strukturu.

Postupujte podle příručky
PŘÍKLAD SKUTEČNÉHO NÁSTROJE
PředPrvní strana čtyřstránkového zdrojového PDF.
  • 4 stránek PDF
PoFormátovaný úvodní výňatek skutečného exportu document.xml.
  • document.xml · 4 záznamů stránek
  • 1 odkazovaný soubor PNG
Výsledkem jsou strukturovaná data XML, zobrazená jako výňatek. Kompletní export obsahuje všechny čtyři stránky a odkazovaný obrázek.
Advertisements
RYCHLÝ VIDEO TUTORIÁL Jak převést PDF do XML s daty o rozvržení Získejte strukturovaná data stránek pro svůj vlastní pracovní postup. Anglický komentář Sledovat video

Jak převést PDF do XML s daty o rozvržení

Advertisements

Otevřete PDF do XML pro export záznamů stránek, textových bloků a dat o kresbách. Naše čtyřstránkové PDF vytvoří document.xml a jeden odkazovaný obrázek PNG uvnitř ZIPu.

01

Vyberte stránky PDF

Nahrajte PDF a nechte Stránky prázdné pro celý dokument, nebo zadejte podmnožinu, kterou potřebujete. Náš příklad obsahuje všechny čtyři stránky.

02

Exportujte a ponechte podklady pohromadě

Zvolte Start. Export s obrazovými podklady se stáhne jako ZIP. Rozbalte celý archiv a ponechte adresář images vedle document.xml.

Ukázka obsahuje images/page-001-image-005.png. Odkazy na obrázky směřují na cesty k souborům namísto vkládání binárních dat do XML. Export bez obrazových podkladů lze stáhnout přímo jako .xml.

03

Přečtěte strukturu dokumentu

Ukázka deklaruje verzi 1, jednotky pt a počátek vlevo nahoře. Záznamy stránek obsahují číslo zdrojové stránky, rozměry, rotaci, bloky a kresby. Souřadnice popisují neotočenou stránku; při překrývání dat zohledněte rotaci.

Analyzujte XML pomocí parseru XML. Opakované hodnoty používají prvky položek; některé geometrické n-tice jsou textové hodnoty. Prozkoumejte skutečnou strukturu namísto předpokládání publikačního schématu, jako je DocBook.

Před použitím dat ve svém pracovním postupu zkontrolujte pořadí čtení a odkazy na obrázky oproti původnímu PDF.

PÁR UŽITEČNÝCH DETAILŮ

Časté dotazy

Obsahuje XML sémantické kapitoly?

Popisuje extrahovaná data stránek. Význam nadpisů, pořadí čtení a sémantika dokumentu mohou vyžadovat vaši vlastní interpretaci.

Proč jsem obdržel ZIP?

Ukázka obsahuje obrázek. ZIP udržuje document.xml a odkazovaný soubor pohromadě, aby bylo možné obrázek najít.

ŘADA JE NA VÁS

Vyzkoušejte to se svým dokumentem

Zkontrolujte výsledek a poté uložte verzi, kterou potřebujete.

Otevřít PDF do XML

Detail obrázku

Advertisements

Jazyk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina