Откройте Извлечение данных из PDF, чтобы собрать значения из одного PDF-файла, не копируя их построчно. Сравнение использует реальный образец документа и CSV, загруженный из инструмента. При выборе Email, телефонов, URL, DOI, ISBN и IPv4 трехстраничный образец дает 11 уникальных строк из 15 вхождений.
Откройте ваш PDF
Загрузите один PDF или выберите Попробовать образец, чтобы проследить за этим примером. Появятся предварительный просмотр PDF и миниатюры страниц. Ваш исходный файл останется без изменений, а извлечение будет выполнено в вашем браузере.
Текстовый справочник, отчет, научная статья или брошюра — полезная отправная точка. Сканы, состоящие только из изображений, требуют OCR, прежде чем их печатный текст можно будет распознать.
Выберите полезные параметры
На телефоне откройте Настройки. На компьютере используйте панель настроек рядом с предварительным просмотром.
В разделе Что извлечь Email, номера телефонов и URL выбраны по умолчанию. Откройте Другие типы данных и также выберите DOI, ISBN и IPv4-адреса. Оставьте удаление дубликатов включенным и выберите CSV.
Извлеките и проверьте совпадения
Выберите Извлечь. Когда обработка завершится, на вкладке Результаты отобразятся значения, количество вхождений и исходные страницы. Выберите номер страницы в кружке, чтобы проверить ее расположение в предварительном просмотре PDF, затем вернитесь к результатам.
Вывод объединяет список контактов с DOI 10.1000/182, ISBN 978-0-306-40615-7 и IPv4-адресом 192.0.2.10 со страницы 2. Столбец «Тип» идентифицирует каждое значение. Отфильтруйте нужное слово или идентификатор перед копированием или скачиванием меньшего подмножества.
Используйте Фильтр результатов, чтобы сузить список. Копирование и скачивание включают все совпадающие строки, даже если таблица результатов занимает несколько экранов.
Скачайте CSV или TXT
Выберите Скачать CSV, затем используйте основную кнопку Скачать на экране готовности. CSV содержит столбцы «Тип», «Значение», «Количество» и «Страницы». TXT и Копировать все содержат по одному значению в строке.
Значения CSV, которые могут быть интерпретированы как формулы электронных таблиц, защищены ведущим апострофом. Например, международный номер телефона начинается с плюса. Используйте TXT, если вам нужен простой список без защиты электронных таблиц.
Часто задаваемые вопросы
Извлекает ли это любой номер или каждый идентификатор?
Нет. Каждая выбранная категория имеет свои правила распознавания. IPv6, проценты, цены и номера платежных карт не извлекаются. Сверяйте совпадения с исходником; корректный формат не гарантирует, что контакт или идентификатор существует.
Что мне делать со сканированным PDF?
Сначала запустите PDF OCR, затем загрузите распознанную копию в этот инструмент. Тщательно проверяйте вывод OCR: ошибочный символ может изменить адрес или идентификатор.
Каковы ограничения на извлечение?
Используйте один PDF размером до 50 МБ и до 750 страниц. Извлечение ограничено 20 000 совпадений в целом и 2 000 на страницу, с бюджетом обработки 90 секунд. Также применяются ограничения на текст и аннотации. Если ограничение или нечитаемая страница прерывают сканирование, инструмент показывает уведомление о частичных результатах и помечает имя файла экспорта как частичное.
Открываются ли мои PDF-ссылки автоматически?
Нет. Извлечение считывает файл в браузере и не посещает извлеченные пункты назначения. Кнопки страниц перемещаются внутри предварительного просмотра PDF.
Сохраняйте значения и их контекст
Извлеките целевой список, проверьте исходные страницы и скачайте формат, который подходит для вашего следующего шага.

