Инструменты150

ПРАКТИЧЕСКОЕ РУКОВОДСТВО ПО PDF

Как извлечь структурированныеданные из PDF

Собирайте контакты и исследовательские идентификаторы в один организованный список.

При выборе Email, телефонов, URL, DOI, ISBN и IPv4 трехстраничный образец дает 11 уникальных строк из 15 вхождений.

Перейти к инструкции
ПРИМЕР РАБОТЫ ИНСТРУМЕНТА
Страница PDFСтраница из реального образца PDF
Извлеченные значенияЗначения и ссылки на страницы из реального скачивания CSV
Шесть выбранных типов данных дают 11 уникальных строк в реальном CSV, включая записи DOI, ISBN и IPv4 на странице 2.
Advertisements
КРАТКИЙ ВИДЕОУРОК Как извлечь структурированные данные из PDF Собирайте контакты и исследовательские идентификаторы в один организованный список. Английская озвучка Смотреть видео

Как извлечь структурированные данные из PDF

Advertisements

Откройте Извлечение данных из PDF, чтобы собрать значения из одного PDF-файла, не копируя их построчно. Сравнение использует реальный образец документа и CSV, загруженный из инструмента. При выборе Email, телефонов, URL, DOI, ISBN и IPv4 трехстраничный образец дает 11 уникальных строк из 15 вхождений.

01

Откройте ваш PDF

Загрузите один PDF или выберите Попробовать образец, чтобы проследить за этим примером. Появятся предварительный просмотр PDF и миниатюры страниц. Ваш исходный файл останется без изменений, а извлечение будет выполнено в вашем браузере.

Текстовый справочник, отчет, научная статья или брошюра — полезная отправная точка. Сканы, состоящие только из изображений, требуют OCR, прежде чем их печатный текст можно будет распознать.

02

Выберите полезные параметры

На телефоне откройте Настройки. На компьютере используйте панель настроек рядом с предварительным просмотром.

В разделе Что извлечь Email, номера телефонов и URL выбраны по умолчанию. Откройте Другие типы данных и также выберите DOI, ISBN и IPv4-адреса. Оставьте удаление дубликатов включенным и выберите CSV.

03

Извлеките и проверьте совпадения

Выберите Извлечь. Когда обработка завершится, на вкладке Результаты отобразятся значения, количество вхождений и исходные страницы. Выберите номер страницы в кружке, чтобы проверить ее расположение в предварительном просмотре PDF, затем вернитесь к результатам.

Вывод объединяет список контактов с DOI 10.1000/182, ISBN 978-0-306-40615-7 и IPv4-адресом 192.0.2.10 со страницы 2. Столбец «Тип» идентифицирует каждое значение. Отфильтруйте нужное слово или идентификатор перед копированием или скачиванием меньшего подмножества.

Используйте Фильтр результатов, чтобы сузить список. Копирование и скачивание включают все совпадающие строки, даже если таблица результатов занимает несколько экранов.

04

Скачайте CSV или TXT

Выберите Скачать CSV, затем используйте основную кнопку Скачать на экране готовности. CSV содержит столбцы «Тип», «Значение», «Количество» и «Страницы». TXT и Копировать все содержат по одному значению в строке.

Значения CSV, которые могут быть интерпретированы как формулы электронных таблиц, защищены ведущим апострофом. Например, международный номер телефона начинается с плюса. Используйте TXT, если вам нужен простой список без защиты электронных таблиц.

НЕСКОЛЬКО ПОЛЕЗНЫХ ДЕТАЛЕЙ

Часто задаваемые вопросы

Извлекает ли это любой номер или каждый идентификатор?

Нет. Каждая выбранная категория имеет свои правила распознавания. IPv6, проценты, цены и номера платежных карт не извлекаются. Сверяйте совпадения с исходником; корректный формат не гарантирует, что контакт или идентификатор существует.

Что мне делать со сканированным PDF?

Сначала запустите PDF OCR, затем загрузите распознанную копию в этот инструмент. Тщательно проверяйте вывод OCR: ошибочный символ может изменить адрес или идентификатор.

Каковы ограничения на извлечение?

Используйте один PDF размером до 50 МБ и до 750 страниц. Извлечение ограничено 20 000 совпадений в целом и 2 000 на страницу, с бюджетом обработки 90 секунд. Также применяются ограничения на текст и аннотации. Если ограничение или нечитаемая страница прерывают сканирование, инструмент показывает уведомление о частичных результатах и помечает имя файла экспорта как частичное.

Открываются ли мои PDF-ссылки автоматически?

Нет. Извлечение считывает файл в браузере и не посещает извлеченные пункты назначения. Кнопки страниц перемещаются внутри предварительного просмотра PDF.

ВАША ОЧЕРЕДЬ

Сохраняйте значения и их контекст

Извлеките целевой список, проверьте исходные страницы и скачайте формат, который подходит для вашего следующего шага.

Открыть Извлечение данных из PDF

Детали изображения

Advertisements

Язык38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina