Инструменты150

Полезная задача для PDF, сделанная просто

Извлечение ссылок из PDF.

Извлеките полезные ссылки из вашего PDF.

Advertisements
Ваше рабочее пространство PDF
На вашем устройстве
или перетащите файлы сюда
Ваш PDF обрабатывается в этом браузере. PDF
Advertisements

Как извлечь ссылки из PDF

  1. 01

    Выберите один PDF

    Загрузите документ с текстовым слоем или попробуйте образец.

  2. 02

    Извлечение и проверка

    Выберите «Извлечь». Проверьте значения, количество и исходные страницы; отфильтруйте или отсортируйте список.

  3. 03

    Копирование или скачивание

    Скопируйте значения или скачайте CSV со ссылками на страницы, либо простой список TXT.

БлогКак извлечь ссылки и URL из PDFЧитать руководство

Извлечение ссылок из PDF без открытия каждой страницы

Собирайте печатные адреса HTTP/HTTPS, www-адреса и кликабельные веб-ссылки из одного PDF. Сохраняйте ссылки на страницы и скачивайте список без дубликатов в формате CSV или TXT.

Распознанные значения становятся списком со ссылками на исходные страницы.
КРАТКИЙ ВИДЕОУРОК Как извлечь ссылки и URL из PDF Сохраняйте полезные веб-ссылки, не открывая их по одной. Английская озвучка Смотреть видео

Как извлечь ссылки и URL из PDF

Когда это полезно?

Источники

Сбор ссылок на источники

Создайте список литературы из отчетов и исследовательских документов.

Ресурсы

Сохранение полезных адресов

Извлеките адреса, скрытые за кликабельными метками ресурсов.

Обзор

Ведение контрольного списка

Записывайте, где была найдена каждая ссылка, прежде чем проверять ее в другом месте.

Функции и элементы управления

Поиск видимых и кликабельных ссылок

Включайте целевую ссылку, даже если ее метка содержит только «Читать далее».

Как работает извлечение ссылок

Распознаются печатные ссылки, начинающиеся с http://, https:// или www. Аннотации ссылок в PDF также могут раскрывать цели HTTP/HTTPS, скрытые за обычным текстом. PDF не обязательно должен отображать URL как кликабельную метку.

Идентичные печатные цели и аннотации на странице не учитываются дважды. Для сравнения дубликатов используются нормализованные формы URL, при этом отображается первое распознанное написание. Длинные, перенесенные или поврежденные URL могут потребовать ручной корректировки. Ни один извлеченный URL не запрашивается автоматически.

Просмотр значений вместе с исходными страницами

Проверяйте количество, переходите к странице PDF и фильтруйте список результатов.

Просмотр и систематизация

Каждый результат записывает физическое положение страницы в PDF, которое может отличаться от напечатанных номеров страниц. Выберите чип страницы, чтобы открыть предварительный просмотр с приблизительной подсветкой.

Удаление дубликатов включено по умолчанию. Количество объединяет распознанные повторения одного и того же значения; выключите эту функцию, чтобы увидеть отдельные вхождения. Сортировка по алфавиту меняет порядок списка. Фильтрация применяется как к копированию и скачиванию, так и к видимым строкам.

Копирование значений или скачивание структурированного списка

Выберите CSV для количества и страниц или TXT для одного значения в строке.

Что содержит каждое скачивание

CSV содержит столбцы Тип, Значение, Количество и Страницы. Кодировка UTF-8 поддерживает арабский и другие языки. Значения, которые могут быть интерпретированы как формулы электронных таблиц, предваряются апострофом для более безопасного импорта.

TXT и «Копировать все» содержат только значения, по одному в строке. Включаются все строки, соответствующие фильтру, даже если таблица на экране занимает несколько страниц результатов. Новый PDF не создается, а исходный PDF остается без изменений.

Управление большими объемами извлеченных данных

Обрабатывайте один PDF в своем браузере с явными ограничениями и уведомлениями о частичных результатах.

Файлы, ограничения и отсканированные страницы

Загрузите один PDF размером до 50 МБ и до 500 страниц. Извлечение проверяет до 250 000 символов и 2 000 совпадений на страницу, 10 миллионов символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Бюджет времени на извлечение в 90 секунд ограничивает длительные процессы. Очень сложные документы могут лучше обрабатываться при разделении на файлы меньшего размера.

Когда предел достигнут или страница не может быть полностью прочитана, результаты показывают уведомление, а ограниченные или неудачные запуски экспортируются с пометкой partial в имени файла. Страницы без выделяемого текста считаются отдельно. Используйте PDF OCR для сканированных изображений, затем вернитесь, чтобы извлечь распознанный текст.

Содержимое PDF обрабатывается локально в этом браузере. Загруженные документы не отправляются на сервер извлечения. Ссылки, адреса электронной почты и номера телефонов, найденные внутри PDF, никогда не запрашиваются автоматически.

Поддерживаемые файлы и обработка

Входные данные
PDF
Выходные данные
CSV / TXT

Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.

Обработка происходит на вашем устройстве без загрузки документа. Скачайте результат перед закрытием страницы; сохраните оригинал отдельно.

Advertisements
FAQ

Полезные ответы

Узнайте, чего ожидать, прежде чем начать.

На вашем устройстве
Что может распознать этот инструмент?

Собирайте печатные HTTP/HTTPS-адреса, www-адреса и цели кликабельных веб-ссылок из одного PDF. Сохраняйте ссылки на страницы и скачивайте список без дубликатов в формате CSV или TXT. Инструмент не проверяет работоспособность ссылок. Внутренние переходы по страницам, JavaScript-действия, mailto и другие не-веб-схемы не экспортируются как веб-ссылки.

Можно ли извлекать данные из отсканированных PDF?

Считывается только выделяемый текст и распознанные цели ссылок. Страницы, состоящие только из изображений, требуют предварительного OCR. Выполните OCR, скачайте PDF с возможностью поиска, а затем вернитесь к этому инструменту извлечения.

Как обрабатываются дубликаты и количество?

Функция удаления дубликатов объединяет распознанные эквивалентные значения. Столбец «Количество» показывает число обнаруженных вхождений, а «Страницы» — физические номера страниц PDF. Отключите эту опцию, чтобы сохранить вхождения раздельно. Печатный текст ссылки и соответствующая кликабельная ссылка на одной странице не считаются дважды.

В чем разница между CSV и TXT?

CSV включает тип, значение, количество вхождений и ссылки на страницы. TXT и функция «Копировать все» предоставляют только значения, по одному в строке. Включаются все строки, соответствующие текущему фильтру, а не только видимая страница таблицы.

Загружается ли PDF для извлечения?

Нет. Разбор PDF, сопоставление и экспорт выполняются в этом браузере. Исходный PDF остается без изменений. Ни одна извлеченная ссылка, адрес электронной почты или номер телефона не запрашивается автоматически.

Какие существуют ограничения?

Один PDF объемом до 50 MiB и до 500 страниц. Извлечение ограничено 250 000 текстовых символов и 2 000 совпадений на страницу, 10 миллионами символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Результаты будут содержать уведомление, если из-за ограничений или нечитаемых страниц данные оказались неполными.

Продолжить

Что вы хотите сделать дальше?

Выберите инструмент. Ваш готовый PDF останется с вами.

PDF

Advertisements

Язык38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina