Сбор идентификаторов
Собирайте значения DOI и ISBN вместе со страницами, на которых они появляются.
Найдите нужные данные. Сохраняйте исходную страницу для каждого результата.
| Тип | Значение | Количество | Страницы |
|---|
Копирование и скачивание включают все совпадающие строки со всех страниц результатов. CSV содержит количество и номера страниц PDF; TXT содержит только значения.
Выберите номер страницы в результатах, чтобы проверить источник. Подсветка показывает примерное расположение.
Ваш список готов. Скачайте его или вернитесь назад, чтобы проверить и изменить формат.
Загрузите документ с текстовым слоем или попробуйте образец.
Выберите «Извлечь». Проверьте значения, количество и исходные страницы; отфильтруйте или отсортируйте список.
Скопируйте значения или скачайте CSV со ссылками на страницы, либо простой список TXT.
Выберите нужные типы данных: адреса электронной почты, номера телефонов, URL-адреса, числовые даты, IPv4-адреса, домены, DOI, ISBN, хэштеги и MAC-адреса. Просматривайте извлеченные значения с количеством и ссылками на страницы.
Собирайте значения DOI и ISBN вместе со страницами, на которых они появляются.
Найдите записи с датами и IPv4-адреса.
Объединяйте адреса электронной почты, телефоны и веб-ссылки в один структурированный экспорт.
Начните с электронной почты, телефонов и URL-адресов, затем откройте «Больше типов данных» для специализированных значений.
Даты должны использовать числовой формат с четырехзначным годом; неоднозначные значения дня/месяца сохраняют исходный порядок. Октеты IPv4 проверяются; IPv6 не включен.
Домены извлекаются из распознанных адресов электронной почты и веб-ссылок, а не из произвольных имен файлов. Извлечение DOI охватывает распространенные современные формы DOI, а не все исторические формы. Значения ISBN-13 требуют действительной контрольной суммы; ISBN-10 также требует метку ISBN. Хэштеги могут содержать символы Unicode, включая арабские.
MAC-адреса используют шесть пар, разделенных двоеточиями или дефисами. Инструмент никогда не связывается с извлеченными адресами или идентификаторами.
Проверяйте количество, переходите к странице PDF и фильтруйте список результатов.
Каждый результат записывает физическое положение страницы в PDF, которое может отличаться от напечатанных номеров страниц. Выберите чип страницы, чтобы открыть предварительный просмотр с приблизительной подсветкой.
Удаление дубликатов включено по умолчанию. Количество объединяет распознанные повторения одного и того же значения; выключите эту функцию, чтобы увидеть отдельные вхождения. Сортировка по алфавиту меняет порядок списка. Фильтрация применяется как к копированию и скачиванию, так и к видимым строкам.
Выберите CSV для количества и страниц или TXT для одного значения в строке.
CSV содержит столбцы Тип, Значение, Количество и Страницы. Кодировка UTF-8 поддерживает арабский и другие языки. Значения, которые могут быть интерпретированы как формулы электронных таблиц, предваряются апострофом для более безопасного импорта.
TXT и «Копировать все» содержат только значения, по одному в строке. Включаются все строки, соответствующие фильтру, даже если таблица на экране занимает несколько страниц результатов. Новый PDF не создается, а исходный PDF остается без изменений.
Обрабатывайте один PDF в своем браузере с явными ограничениями и уведомлениями о частичных результатах.
Загрузите один PDF размером до 50 МБ и до 500 страниц. Извлечение проверяет до 250 000 символов и 2 000 совпадений на страницу, 10 миллионов символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Бюджет времени на извлечение в 90 секунд ограничивает длительные процессы. Очень сложные документы могут лучше обрабатываться при разделении на файлы меньшего размера.
Когда предел достигнут или страница не может быть полностью прочитана, результаты показывают уведомление, а ограниченные или неудачные запуски экспортируются с пометкой partial в имени файла. Страницы без выделяемого текста считаются отдельно. Используйте PDF OCR для сканированных изображений, затем вернитесь, чтобы извлечь распознанный текст.
Содержимое PDF обрабатывается локально в этом браузере. Загруженные документы не отправляются на сервер извлечения. Ссылки, адреса электронной почты и номера телефонов, найденные внутри PDF, никогда не запрашиваются автоматически.
Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.
Обработка происходит на вашем устройстве без загрузки документа. Скачайте результат перед закрытием страницы; сохраните оригинал отдельно.
Узнайте, чего ожидать, прежде чем начать.
На вашем устройствеВыберите нужные типы данных: email, номера телефонов, URL, числовые даты, IPv4-адреса, домены, DOI, ISBN, хэштеги и MAC-адреса. Просматривайте извлеченные значения с указанием количества и ссылок на страницы. Инструмент извлекает распознаваемые значения, а не таблицы, счета или семантические поля. Шаблоны и контрольные суммы снижают уровень шума, но не гарантируют полноту и не доказывают подлинность идентификатора.
Считывается только выделяемый текст и распознанные цели ссылок. Страницы, состоящие только из изображений, требуют предварительного OCR. Выполните OCR, скачайте PDF с возможностью поиска, а затем вернитесь к этому инструменту извлечения.
Функция удаления дубликатов объединяет распознанные эквивалентные значения. Столбец «Количество» показывает число обнаруженных вхождений, а «Страницы» — физические номера страниц PDF. Отключите эту опцию, чтобы сохранить вхождения раздельно. Печатный текст ссылки и соответствующая кликабельная ссылка на одной странице не считаются дважды.
CSV включает тип, значение, количество вхождений и ссылки на страницы. TXT и функция «Копировать все» предоставляют только значения, по одному в строке. Включаются все строки, соответствующие текущему фильтру, а не только видимая страница таблицы.
Нет. Разбор PDF, сопоставление и экспорт выполняются в этом браузере. Исходный PDF остается без изменений. Ни одна извлеченная ссылка, адрес электронной почты или номер телефона не запрашивается автоматически.
Один PDF объемом до 50 MiB и до 500 страниц. Извлечение ограничено 250 000 текстовых символов и 2 000 совпадений на страницу, 10 миллионами символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Результаты будут содержать уведомление, если из-за ограничений или нечитаемых страниц данные оказались неполными.
КРАТКИЙ ВИДЕОУРОК
Как извлечь структурированные данные из PDF
Собирайте контакты и исследовательские идентификаторы в один организованный список.
Английская озвучка
Смотреть видео