Инструменти150

ПРАКТИЧЕСКО РЪКОВОДСТВО ЗА PDF

Как да конвертирате PDF в XML с данни за оформлението

Получете структурирани данни за страници за вашия собствен работен процес.

Експортирайте PDF текст, размери на страници и данни за чертежи като XML. Дръжте реферираните изображения заедно и проверете структурата, преди да я използвате в код.

Следвайте ръководството
ПРИМЕР С РЕАЛЕН ИНСТРУМЕНТ
ПредиПърва страница от PDF източника с четири страници.
  • 4 PDF страници
СледКрасиво форматиран начален откъс от действителния експорт на document.xml.
  • document.xml · 4 записа на страници
  • 1 рефериран PNG актив
Резултатът е структурирани XML данни, показани като откъс. Пълният експорт включва всички четири страници и реферирания графичен актив.
Advertisements
КРАТЪК ВИДЕО УРОК Как да конвертирате PDF в XML с данни за оформлението Получете структурирани данни за страници за вашия собствен работен процес. Английски разказ Гледайте видеото

Как да конвертирате PDF в XML с данни за оформлението

Advertisements

Отворете PDF към XML, за да експортирате записи на страници, текстови блокове и данни за чертежи. Нашият PDF от четири страници генерира document.xml плюс едно реферирано PNG изображение в ZIP архив.

01

Изберете PDF страниците

Заредете PDF файла и оставете Страници празно за целия документ или въведете подмножеството, от което се нуждаете. Нашият пример включва всички четири страници.

02

Експортирайте и дръжте активите заедно

Изберете Старт. Експорт с графични активи се изтегля като ZIP. Извлечете целия архив и дръжте директорията images до document.xml.

Примерът включва images/page-001-image-005.png. Референциите към изображения сочат към пътища на активи, вместо да вграждат двоични данни в XML. Експорт без графични активи може да се изтегли директно като .xml.

03

Прочетете структурата на документа

Примерът декларира версия 1, единици pt и начало горе вляво. Записите на страници включват номер на изходната страница, размери, ротация, блокове и чертежи. Координатите описват неротираната страница; вземете предвид ротацията, когато наслагвате данните.

Парснете XML файла с XML парсер. Повтарящите се стойности използват елементи от тип item; някои геометрични кортежи са текстови стойности. Проверете действителната структура, вместо да предполагате схема за публикуване като DocBook.

Проверете реда на четене и референциите към изображения спрямо оригиналния PDF, преди да използвате данните във вашия работен процес.

НЯКОЛКО ПОЛЕЗНИ ДЕТАЙЛА

Често задавани въпроси

Съдържа ли XML файлът семантични глави?

Той описва извлечените данни за страницата. Значението на заглавията, редът на четене и семантиката на документа може да изискват ваша собствена интерпретация.

Защо получих ZIP файл?

Примерът съдържа изображение. ZIP архивът държи document.xml и реферирания актив заедно, така че изображението да може да бъде намерено.

ВАШИЯТ РЕД

Опитайте с вашия документ

Прегледайте резултата, след което запазете версията, от която се нуждаете.

Отворете PDF към XML

Детайли на изображението

Advertisements

език38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina