Инструменты150

Полезная задача для PDF, сделанная просто

Извлечение данных из PDF.

Найдите нужные данные. Сохраняйте исходную страницу для каждого результата.

Advertisements
Ваше рабочее пространство PDF
На вашем устройстве
или перетащите файлы сюда
Ваш PDF обрабатывается в этом браузере. PDF
Advertisements

Как извлечь данные из PDF

  1. 01

    Выберите один PDF

    Загрузите документ с текстовым слоем или попробуйте образец.

  2. 02

    Извлечение и проверка

    Выберите «Извлечь». Проверьте значения, количество и исходные страницы; отфильтруйте или отсортируйте список.

  3. 03

    Копирование или скачивание

    Скопируйте значения или скачайте CSV со ссылками на страницы, либо простой список TXT.

БлогКак извлечь структурированные данные из PDFЧитать руководство

Извлечение структурированных значений из PDF в CSV или текст

Выберите нужные типы данных: адреса электронной почты, номера телефонов, URL-адреса, числовые даты, IPv4-адреса, домены, DOI, ISBN, хэштеги и MAC-адреса. Просматривайте извлеченные значения с количеством и ссылками на страницы.

Распознанные значения становятся списком со ссылками на исходные страницы.
КРАТКИЙ ВИДЕОУРОК Как извлечь структурированные данные из PDF Собирайте контакты и исследовательские идентификаторы в один организованный список. Английская озвучка Смотреть видео

Как извлечь структурированные данные из PDF

Когда это полезно?

Исследования

Сбор идентификаторов

Собирайте значения DOI и ISBN вместе со страницами, на которых они появляются.

Отчеты

Извлечение числовых данных

Найдите записи с датами и IPv4-адреса.

Справочники

Создание списка контактов

Объединяйте адреса электронной почты, телефоны и веб-ссылки в один структурированный экспорт.

Функции и элементы управления

Выберите полезные типы данных

Начните с электронной почты, телефонов и URL-адресов, затем откройте «Больше типов данных» для специализированных значений.

Что поддерживают распознаватели

Даты должны использовать числовой формат с четырехзначным годом; неоднозначные значения дня/месяца сохраняют исходный порядок. Октеты IPv4 проверяются; IPv6 не включен.

Домены извлекаются из распознанных адресов электронной почты и веб-ссылок, а не из произвольных имен файлов. Извлечение DOI охватывает распространенные современные формы DOI, а не все исторические формы. Значения ISBN-13 требуют действительной контрольной суммы; ISBN-10 также требует метку ISBN. Хэштеги могут содержать символы Unicode, включая арабские.

MAC-адреса используют шесть пар, разделенных двоеточиями или дефисами. Инструмент никогда не связывается с извлеченными адресами или идентификаторами.

Просмотр значений вместе с исходными страницами

Проверяйте количество, переходите к странице PDF и фильтруйте список результатов.

Просмотр и систематизация

Каждый результат записывает физическое положение страницы в PDF, которое может отличаться от напечатанных номеров страниц. Выберите чип страницы, чтобы открыть предварительный просмотр с приблизительной подсветкой.

Удаление дубликатов включено по умолчанию. Количество объединяет распознанные повторения одного и того же значения; выключите эту функцию, чтобы увидеть отдельные вхождения. Сортировка по алфавиту меняет порядок списка. Фильтрация применяется как к копированию и скачиванию, так и к видимым строкам.

Копирование значений или скачивание структурированного списка

Выберите CSV для количества и страниц или TXT для одного значения в строке.

Что содержит каждое скачивание

CSV содержит столбцы Тип, Значение, Количество и Страницы. Кодировка UTF-8 поддерживает арабский и другие языки. Значения, которые могут быть интерпретированы как формулы электронных таблиц, предваряются апострофом для более безопасного импорта.

TXT и «Копировать все» содержат только значения, по одному в строке. Включаются все строки, соответствующие фильтру, даже если таблица на экране занимает несколько страниц результатов. Новый PDF не создается, а исходный PDF остается без изменений.

Управление большими объемами извлеченных данных

Обрабатывайте один PDF в своем браузере с явными ограничениями и уведомлениями о частичных результатах.

Файлы, ограничения и отсканированные страницы

Загрузите один PDF размером до 50 МБ и до 500 страниц. Извлечение проверяет до 250 000 символов и 2 000 совпадений на страницу, 10 миллионов символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Бюджет времени на извлечение в 90 секунд ограничивает длительные процессы. Очень сложные документы могут лучше обрабатываться при разделении на файлы меньшего размера.

Когда предел достигнут или страница не может быть полностью прочитана, результаты показывают уведомление, а ограниченные или неудачные запуски экспортируются с пометкой partial в имени файла. Страницы без выделяемого текста считаются отдельно. Используйте PDF OCR для сканированных изображений, затем вернитесь, чтобы извлечь распознанный текст.

Содержимое PDF обрабатывается локально в этом браузере. Загруженные документы не отправляются на сервер извлечения. Ссылки, адреса электронной почты и номера телефонов, найденные внутри PDF, никогда не запрашиваются автоматически.

Поддерживаемые файлы и обработка

Входные данные
PDF
Выходные данные
CSV / TXT

Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.

Обработка происходит на вашем устройстве без загрузки документа. Скачайте результат перед закрытием страницы; сохраните оригинал отдельно.

Advertisements
FAQ

Полезные ответы

Узнайте, чего ожидать, прежде чем начать.

На вашем устройстве
Что может распознать этот инструмент?

Выберите нужные типы данных: email, номера телефонов, URL, числовые даты, IPv4-адреса, домены, DOI, ISBN, хэштеги и MAC-адреса. Просматривайте извлеченные значения с указанием количества и ссылок на страницы. Инструмент извлекает распознаваемые значения, а не таблицы, счета или семантические поля. Шаблоны и контрольные суммы снижают уровень шума, но не гарантируют полноту и не доказывают подлинность идентификатора.

Можно ли извлекать данные из отсканированных PDF?

Считывается только выделяемый текст и распознанные цели ссылок. Страницы, состоящие только из изображений, требуют предварительного OCR. Выполните OCR, скачайте PDF с возможностью поиска, а затем вернитесь к этому инструменту извлечения.

Как обрабатываются дубликаты и количество?

Функция удаления дубликатов объединяет распознанные эквивалентные значения. Столбец «Количество» показывает число обнаруженных вхождений, а «Страницы» — физические номера страниц PDF. Отключите эту опцию, чтобы сохранить вхождения раздельно. Печатный текст ссылки и соответствующая кликабельная ссылка на одной странице не считаются дважды.

В чем разница между CSV и TXT?

CSV включает тип, значение, количество вхождений и ссылки на страницы. TXT и функция «Копировать все» предоставляют только значения, по одному в строке. Включаются все строки, соответствующие текущему фильтру, а не только видимая страница таблицы.

Загружается ли PDF для извлечения?

Нет. Разбор PDF, сопоставление и экспорт выполняются в этом браузере. Исходный PDF остается без изменений. Ни одна извлеченная ссылка, адрес электронной почты или номер телефона не запрашивается автоматически.

Какие существуют ограничения?

Один PDF объемом до 50 MiB и до 500 страниц. Извлечение ограничено 250 000 текстовых символов и 2 000 совпадений на страницу, 10 миллионами символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Результаты будут содержать уведомление, если из-за ограничений или нечитаемых страниц данные оказались неполными.

Продолжить

Что вы хотите сделать дальше?

Выберите инструмент. Ваш готовый PDF останется с вами.

PDF

Advertisements

Язык38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina