Налаштування робочого процесу обробки XML
Експортуйте вміст сторінки як XML для скрипта або програми, що розуміє задокументовану структуру виводу.
Експортуйте текст, зображення та геометричні фігури PDF у формат XML.
Використовуйте елементи керування сторінками для перевірки документа.
Завантажте результат або поверніться до налаштувань, щоб створити іншу версію.
Завантажте один PDF-файл зі свого пристрою.
Перегляньте доступні налаштування, а потім почніть обробку.
Збережіть результат і перевірте його перед поширенням.
Експортуйте текст, зображення та геометрію малюнків PDF у формат XML. Вибирайте сторінки та завантажуйте структурований опис із доданими за потреби графічними ресурсами.
Експортуйте вміст сторінки як XML для скрипта або програми, що розуміє задокументовану структуру виводу.
Використовуйте координати вмісту для вивчення макета сторінки; вони стосуються неротованої сторінки PDF, а не пікселів браузера.
Переглядайте витягнуті об'єкти перед створенням правил аналізу для конкретного документа. Скани потребують OCR для розпізнавання тексту.
Отримуйте структурований опис вмісту сторінки, а не просто звичайну розшифровку.
Версійна структура включає сторінки, текстові блоки та діапазони, шрифти, обмежувальні рамки та векторні шляхи малювання. Координати вказані в пунктах PDF від верхнього лівого кута нерозгорнутої сторінки; поворот записується окремо. Це може підтримувати індексацію або аналіз документа, але конвертер не виводить вашу власну бізнес-схему чи назви семантичних полів.
Отримуйте прямий файл даних або ZIP-архів, якщо включено витягнуті зображення.
Коли сторінка містить дані зображення, архів містить document.json або document.xml плюс посилані файли зображень та будь-які підтримувані маски. Зберігайте ці шляхи разом під час завантаження даних в іншому місці. Скановане зображення залишається даними зображення; цей експорт не виконує OCR для створення відсутніх текстових фрагментів.
Обробіть весь документ або введіть конкретні номери сторінок та діапазони.
Використовуйте позиції PDF, починаючи з 1, а не номери, надруковані на сторінці. Список, наприклад 1, 3-5, включає чотири сторінки. Порожній діапазон використовує всі сторінки. Перевірте попередній перегляд, якщо документ містить обкладинку або розділи з іншою нумерацією. У цю конвертацію включаються лише вибрані сторінки.
Вилучення тексту зчитує текстовий шар; воно не розпізнає літери на зображеннях.
Вилучення використовує існуючий текстовий шар і не розпізнає літери на зображеннях сторінок. Якщо на сторінці немає читабельного тексту, використовуйте PDF OCR окремо. Порожня сторінка також може не дати тексту. Для змішаних PDF-файлів перевіряйте порожні або нечитабельні сторінки окремо. OCR обробляє одну вибрану сторінку за раз.
Відкрийте один PDF розміром до 100 МБ та 750 сторінок. Для складних документів можуть застосовуватися додаткові обмеження щодо виводу, пам'яті та обробки.
Обробка використовує наші сервери. Вихідні файли, тимчасові файли та результати видаляються з наших серверів протягом 30 хвилин після завершення обробки. Ми не передаємо вміст документів третім особам і не використовуємо його для навчання моделей ШІ.
Знайте, чого очікувати, перш ніж почати.
Тимчасова обробка на серверіВін експортує вміст сторінки та геометрію, а не автоматично названі бізнес-поля. Ваш додаток повинен інтерпретувати цю структуру. Для клітинок таблиць використовуйте Extract Tables from PDF; для сканів використовуйте PDF OCR.
Версійна структура включає сторінки, текстові блоки та діапазони, шрифти, обмежувальні рамки та шляхи векторних малюнків. Координати вказані в пунктах PDF від верхнього лівого кута не повернутої сторінки; поворот записується окремо. Це може підтримувати індексацію або аналіз документа, але конвертер не виводить вашу власну бізнес-схему або назви семантичних полів.
Коли сторінка містить дані зображення, архів містить document.json або document.xml плюс посилані файли зображень та будь-які підтримувані маски. Тримайте ці шляхи разом при завантаженні даних в іншому місці. Скановане зображення залишається даними зображення; цей експорт не виконує OCR для створення відсутніх текстових діапазонів.
Вилучення використовує існуючий текстовий шар і не розпізнає літери на зображеннях сторінок. Якщо сторінка не має читабельного тексту, використовуйте PDF OCR окремо. Порожня сторінка також може не дати тексту. Для змішаних PDF-файлів перевіряйте порожні або нечитабельні сторінки окремо. OCR обробляє одну вибрану сторінку за раз.
Відкрийте один PDF розміром до 100 МБ і 750 вихідних сторінок. Захищені файли потребують розблокованої копії, якщо цей інструмент прямо не пропонує введення пароля. Великі або складні сторінки можуть потребувати більше пам'яті або досягати лімітів обробки, навіть якщо файл знаходиться в межах цих обмежень.
Цей інструмент використовує наші сервери для обробки. Ваш оригінальний файл не перезаписується; результат — це окремий файл для завантаження. Переглядайте та перевіряйте результат, де це можливо, і завантажуйте потрібну копію перед початком роботи спочатку.
ШВИДКИЙ ВІДЕОУРОК
Як конвертувати PDF у XML з даними про макет
Отримайте структуровані дані сторінок для власного робочого процесу.
Англійська озвучка
Дивитися відео