Инструменты150

ПРАКТИЧЕСКОЕ РУКОВОДСТВО ПО PDF

Как конвертировать PDF в XML с данными о макете

Получите структурированные данные страницы для вашего рабочего процесса.

Экспортируйте текст PDF, размеры страниц и данные о графике в формате XML. Храните связанные изображения вместе и изучите структуру перед использованием в коде.

Перейти к инструкции
ПРИМЕР РЕАЛЬНОГО ИНСТРУМЕНТА
ДоПервая страница четырехстраничного исходного PDF.
  • 4 страницы PDF
ПослеКрасиво отформатированный начальный фрагмент экспортированного файла document.xml.
  • document.xml · 4 записи страниц
  • 1 связанный ресурс PNG
Результатом являются структурированные данные XML, показанные в виде фрагмента. Полный экспорт включает все четыре страницы и связанный файл изображения.
Advertisements
КРАТКИЙ ВИДЕОУРОК Как конвертировать PDF в XML с данными о макете Получите структурированные данные страницы для вашего рабочего процесса. Английская озвучка Смотреть видео

Как конвертировать PDF в XML с данными о макете

Advertisements

Откройте PDF в XML, чтобы экспортировать записи страниц, текстовые блоки и данные о графике. Наш четырехстраничный PDF создает document.xml плюс одно связанное изображение PNG внутри ZIP.

01

Выберите страницы PDF

Загрузите PDF и оставьте Страницы пустыми для всего документа или введите нужный диапазон. Наш пример включает все четыре страницы.

02

Экспортируйте и храните ресурсы вместе

Выберите Начать. Экспорт с изображениями загружается в виде ZIP. Распакуйте весь архив и храните каталог images рядом с document.xml.

Пример включает images/page-001-image-005.png. Ссылки на изображения указывают на пути к ресурсам, а не встраивают бинарные данные в XML. Экспорт без изображений можно скачать напрямую как .xml.

03

Прочитайте структуру документа

В примере указана версия 1, единицы измерения pt и начало координат top-left. Записи страниц включают номер исходной страницы, размеры, поворот, блоки и графику. Координаты описывают страницу без учета поворота; учитывайте поворот при наложении данных.

Разберите XML с помощью парсера XML. Повторяющиеся значения используют элементы item; некоторые геометрические кортежи являются текстовыми значениями. Изучите фактическую структуру, вместо того чтобы полагаться на схему публикации, такую как DocBook.

Проверьте порядок чтения и ссылки на изображения в исходном PDF перед использованием данных в вашем рабочем процессе.

НЕСКОЛЬКО ПОЛЕЗНЫХ ДЕТАЛЕЙ

Часто задаваемые вопросы

Содержит ли XML семантические главы?

Он описывает извлеченные данные страницы. Значение заголовков, порядок чтения и семантика документа могут потребовать вашей собственной интерпретации.

Почему я получил ZIP?

Пример содержит изображение. ZIP хранит document.xml и связанный ресурс вместе, чтобы изображение можно было найти.

ВАША ОЧЕРЕДЬ

Попробуйте на своем документе

Просмотрите результат, затем сохраните нужную версию.

Открыть PDF в XML

Детали изображения

Advertisements

Язык38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina