Откройте PDF в XML, чтобы экспортировать записи страниц, текстовые блоки и данные о графике. Наш четырехстраничный PDF создает document.xml плюс одно связанное изображение PNG внутри ZIP.
Выберите страницы PDF
Загрузите PDF и оставьте Страницы пустыми для всего документа или введите нужный диапазон. Наш пример включает все четыре страницы.
Экспортируйте и храните ресурсы вместе
Выберите Начать. Экспорт с изображениями загружается в виде ZIP. Распакуйте весь архив и храните каталог images рядом с document.xml.
Пример включает images/page-001-image-005.png. Ссылки на изображения указывают на пути к ресурсам, а не встраивают бинарные данные в XML. Экспорт без изображений можно скачать напрямую как .xml.
Прочитайте структуру документа
В примере указана версия 1, единицы измерения pt и начало координат top-left. Записи страниц включают номер исходной страницы, размеры, поворот, блоки и графику. Координаты описывают страницу без учета поворота; учитывайте поворот при наложении данных.
Разберите XML с помощью парсера XML. Повторяющиеся значения используют элементы item; некоторые геометрические кортежи являются текстовыми значениями. Изучите фактическую структуру, вместо того чтобы полагаться на схему публикации, такую как DocBook.
Проверьте порядок чтения и ссылки на изображения в исходном PDF перед использованием данных в вашем рабочем процессе.
Часто задаваемые вопросы
Содержит ли XML семантические главы?
Он описывает извлеченные данные страницы. Значение заголовков, порядок чтения и семантика документа могут потребовать вашей собственной интерпретации.
Почему я получил ZIP?
Пример содержит изображение. ZIP хранит document.xml и связанный ресурс вместе, чтобы изображение можно было найти.
Попробуйте на своем документе
Просмотрите результат, затем сохраните нужную версию.

