Інструменти150

Корисне завдання з PDF, зроблене просто

PDF у XML.

Експортуйте текст, зображення та геометричні фігури PDF у формат XML.

Advertisements
Ваш робочий простір PDF
Тимчасова обробка на сервері
або перетягніть файли сюди
Надсилається для тимчасової обробки, коли ви починаєте. PDF
Advertisements

Як конвертувати PDF у XML

  1. 01

    Виберіть свій документ

    Завантажте один PDF-файл зі свого пристрою.

  2. 02

    Налаштуйте результат

    Перегляньте доступні налаштування, а потім почніть обробку.

  3. 03

    Завантажте свій файл

    Збережіть результат і перевірте його перед поширенням.

БлогЯк конвертувати PDF у XML з даними про макетЧитати посібник

PDF у XML

Експортуйте текст, зображення та геометрію малюнків PDF у формат XML. Вибирайте сторінки та завантажуйте структурований опис із доданими за потреби графічними ресурсами.

Збереження видимої структури джерела
ШВИДКИЙ ВІДЕОУРОК Як конвертувати PDF у XML з даними про макет Отримайте структуровані дані сторінок для власного робочого процесу. Англійська озвучка Дивитися відео

Як конвертувати PDF у XML з даними про макет

Практичні способи використання цього інструменту

Розробники

Налаштування робочого процесу обробки XML

Експортуйте вміст сторінки як XML для скрипта або програми, що розуміє задокументовану структуру виводу.

Дослідники

Перевірка позицій тексту

Використовуйте координати вмісту для вивчення макета сторінки; вони стосуються неротованої сторінки PDF, а не пікселів браузера.

Технічний огляд

Відокремлення витягнення від інтерпретації

Переглядайте витягнуті об'єкти перед створенням правил аналізу для конкретного документа. Скани потребують OCR для розпізнавання тексту.

Функції та елементи керування

Експорт тексту та геометрії малюнків

Отримуйте структурований опис вмісту сторінки, а не просто звичайну розшифровку.

Схема, координати та поворот сторінки

Версійна структура включає сторінки, текстові блоки та діапазони, шрифти, обмежувальні рамки та векторні шляхи малювання. Координати вказані в пунктах PDF від верхнього лівого кута нерозгорнутої сторінки; поворот записується окремо. Це може підтримувати індексацію або аналіз документа, але конвертер не виводить вашу власну бізнес-схему чи назви семантичних полів.

Зберігайте графічні ресурси поруч із даними

Отримуйте прямий файл даних або ZIP-архів, якщо включено витягнуті зображення.

Файл даних та посилані зображення

Коли сторінка містить дані зображення, архів містить document.json або document.xml плюс посилані файли зображень та будь-які підтримувані маски. Зберігайте ці шляхи разом під час завантаження даних в іншому місці. Скановане зображення залишається даними зображення; цей експорт не виконує OCR для створення відсутніх текстових фрагментів.

Виберіть потрібні сторінки

Обробіть весь документ або введіть конкретні номери сторінок та діапазони.

Діапазони сторінок та нумерація

Використовуйте позиції PDF, починаючи з 1, а не номери, надруковані на сторінці. Список, наприклад 1, 3-5, включає чотири сторінки. Порожній діапазон використовує всі сторінки. Перевірте попередній перегляд, якщо документ містить обкладинку або розділи з іншою нумерацією. У цю конвертацію включаються лише вибрані сторінки.

Використання OCR для сторінок, що містять лише зображення

Вилучення тексту зчитує текстовий шар; воно не розпізнає літери на зображеннях.

Скани, порожні сторінки та OCR

Вилучення використовує існуючий текстовий шар і не розпізнає літери на зображеннях сторінок. Якщо на сторінці немає читабельного тексту, використовуйте PDF OCR окремо. Порожня сторінка також може не дати тексту. Для змішаних PDF-файлів перевіряйте порожні або нечитабельні сторінки окремо. OCR обробляє одну вибрану сторінку за раз.

Підтримувані файли та обробка

Вхідні дані
PDF
Вихідні дані
XML, ZIP

Відкрийте один PDF розміром до 100 МБ та 750 сторінок. Для складних документів можуть застосовуватися додаткові обмеження щодо виводу, пам'яті та обробки.

Обробка використовує наші сервери. Вихідні файли, тимчасові файли та результати видаляються з наших серверів протягом 30 хвилин після завершення обробки. Ми не передаємо вміст документів третім особам і не використовуємо його для навчання моделей ШІ.

Advertisements
Найбільш поширені запитання

Кілька корисних відповідей

Знайте, чого очікувати, перш ніж почати.

Тимчасова обробка на сервері
Чи розпізнає PDF у XML поля рахунків або значення таблиць?

Він експортує вміст сторінки та геометрію, а не автоматично названі бізнес-поля. Ваш додаток повинен інтерпретувати цю структуру. Для клітинок таблиць використовуйте Extract Tables from PDF; для сканів використовуйте PDF OCR.

Яку інформацію містить структурований експорт?

Версійна структура включає сторінки, текстові блоки та діапазони, шрифти, обмежувальні рамки та шляхи векторних малюнків. Координати вказані в пунктах PDF від верхнього лівого кута не повернутої сторінки; поворот записується окремо. Це може підтримувати індексацію або аналіз документа, але конвертер не виводить вашу власну бізнес-схему або назви семантичних полів.

Чому завантаження іноді містить ZIP?

Коли сторінка містить дані зображення, архів містить document.json або document.xml плюс посилані файли зображень та будь-які підтримувані маски. Тримайте ці шляхи разом при завантаженні даних в іншому місці. Скановане зображення залишається даними зображення; цей експорт не виконує OCR для створення відсутніх текстових діапазонів.

Чи вилучить це слова зі сканованого зображення?

Вилучення використовує існуючий текстовий шар і не розпізнає літери на зображеннях сторінок. Якщо сторінка не має читабельного тексту, використовуйте PDF OCR окремо. Порожня сторінка також може не дати тексту. Для змішаних PDF-файлів перевіряйте порожні або нечитабельні сторінки окремо. OCR обробляє одну вибрану сторінку за раз.

Які обмеження на файли та сторінки?

Відкрийте один PDF розміром до 100 МБ і 750 вихідних сторінок. Захищені файли потребують розблокованої копії, якщо цей інструмент прямо не пропонує введення пароля. Великі або складні сторінки можуть потребувати більше пам'яті або досягати лімітів обробки, навіть якщо файл знаходиться в межах цих обмежень.

Де обробляється мій документ?

Цей інструмент використовує наші сервери для обробки. Ваш оригінальний файл не перезаписується; результат — це окремий файл для завантаження. Переглядайте та перевіряйте результат, де це можливо, і завантажуйте потрібну копію перед початком роботи спочатку.

Продовжити

Що ви хочете зробити далі?

Виберіть інструмент. Ваш готовий PDF залишиться з вами.

PDF

Advertisements

Мову38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina