Сбор ссылок на источники
Создайте список литературы из отчетов и исследовательских документов.
Извлеките полезные ссылки из вашего PDF.
| Тип | Значение | Количество | Страницы |
|---|
Копирование и скачивание включают все совпадающие строки со всех страниц результатов. CSV содержит количество и номера страниц PDF; TXT содержит только значения.
Выберите номер страницы в результатах, чтобы проверить источник. Подсветка показывает примерное расположение.
Ваш список готов. Скачайте его или вернитесь назад, чтобы проверить и изменить формат.
Загрузите документ с текстовым слоем или попробуйте образец.
Выберите «Извлечь». Проверьте значения, количество и исходные страницы; отфильтруйте или отсортируйте список.
Скопируйте значения или скачайте CSV со ссылками на страницы, либо простой список TXT.
Собирайте печатные адреса HTTP/HTTPS, www-адреса и кликабельные веб-ссылки из одного PDF. Сохраняйте ссылки на страницы и скачивайте список без дубликатов в формате CSV или TXT.
Создайте список литературы из отчетов и исследовательских документов.
Извлеките адреса, скрытые за кликабельными метками ресурсов.
Записывайте, где была найдена каждая ссылка, прежде чем проверять ее в другом месте.
Включайте целевую ссылку, даже если ее метка содержит только «Читать далее».
Распознаются печатные ссылки, начинающиеся с http://, https:// или www. Аннотации ссылок в PDF также могут раскрывать цели HTTP/HTTPS, скрытые за обычным текстом. PDF не обязательно должен отображать URL как кликабельную метку.
Идентичные печатные цели и аннотации на странице не учитываются дважды. Для сравнения дубликатов используются нормализованные формы URL, при этом отображается первое распознанное написание. Длинные, перенесенные или поврежденные URL могут потребовать ручной корректировки. Ни один извлеченный URL не запрашивается автоматически.
Проверяйте количество, переходите к странице PDF и фильтруйте список результатов.
Каждый результат записывает физическое положение страницы в PDF, которое может отличаться от напечатанных номеров страниц. Выберите чип страницы, чтобы открыть предварительный просмотр с приблизительной подсветкой.
Удаление дубликатов включено по умолчанию. Количество объединяет распознанные повторения одного и того же значения; выключите эту функцию, чтобы увидеть отдельные вхождения. Сортировка по алфавиту меняет порядок списка. Фильтрация применяется как к копированию и скачиванию, так и к видимым строкам.
Выберите CSV для количества и страниц или TXT для одного значения в строке.
CSV содержит столбцы Тип, Значение, Количество и Страницы. Кодировка UTF-8 поддерживает арабский и другие языки. Значения, которые могут быть интерпретированы как формулы электронных таблиц, предваряются апострофом для более безопасного импорта.
TXT и «Копировать все» содержат только значения, по одному в строке. Включаются все строки, соответствующие фильтру, даже если таблица на экране занимает несколько страниц результатов. Новый PDF не создается, а исходный PDF остается без изменений.
Обрабатывайте один PDF в своем браузере с явными ограничениями и уведомлениями о частичных результатах.
Загрузите один PDF размером до 50 МБ и до 500 страниц. Извлечение проверяет до 250 000 символов и 2 000 совпадений на страницу, 10 миллионов символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Бюджет времени на извлечение в 90 секунд ограничивает длительные процессы. Очень сложные документы могут лучше обрабатываться при разделении на файлы меньшего размера.
Когда предел достигнут или страница не может быть полностью прочитана, результаты показывают уведомление, а ограниченные или неудачные запуски экспортируются с пометкой partial в имени файла. Страницы без выделяемого текста считаются отдельно. Используйте PDF OCR для сканированных изображений, затем вернитесь, чтобы извлечь распознанный текст.
Содержимое PDF обрабатывается локально в этом браузере. Загруженные документы не отправляются на сервер извлечения. Ссылки, адреса электронной почты и номера телефонов, найденные внутри PDF, никогда не запрашиваются автоматически.
Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.
Обработка происходит на вашем устройстве без загрузки документа. Скачайте результат перед закрытием страницы; сохраните оригинал отдельно.
Узнайте, чего ожидать, прежде чем начать.
На вашем устройствеСобирайте печатные HTTP/HTTPS-адреса, www-адреса и цели кликабельных веб-ссылок из одного PDF. Сохраняйте ссылки на страницы и скачивайте список без дубликатов в формате CSV или TXT. Инструмент не проверяет работоспособность ссылок. Внутренние переходы по страницам, JavaScript-действия, mailto и другие не-веб-схемы не экспортируются как веб-ссылки.
Считывается только выделяемый текст и распознанные цели ссылок. Страницы, состоящие только из изображений, требуют предварительного OCR. Выполните OCR, скачайте PDF с возможностью поиска, а затем вернитесь к этому инструменту извлечения.
Функция удаления дубликатов объединяет распознанные эквивалентные значения. Столбец «Количество» показывает число обнаруженных вхождений, а «Страницы» — физические номера страниц PDF. Отключите эту опцию, чтобы сохранить вхождения раздельно. Печатный текст ссылки и соответствующая кликабельная ссылка на одной странице не считаются дважды.
CSV включает тип, значение, количество вхождений и ссылки на страницы. TXT и функция «Копировать все» предоставляют только значения, по одному в строке. Включаются все строки, соответствующие текущему фильтру, а не только видимая страница таблицы.
Нет. Разбор PDF, сопоставление и экспорт выполняются в этом браузере. Исходный PDF остается без изменений. Ни одна извлеченная ссылка, адрес электронной почты или номер телефона не запрашивается автоматически.
Один PDF объемом до 50 MiB и до 500 страниц. Извлечение ограничено 250 000 текстовых символов и 2 000 совпадений на страницу, 10 миллионами символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Результаты будут содержать уведомление, если из-за ограничений или нечитаемых страниц данные оказались неполными.
КРАТКИЙ ВИДЕОУРОК
Как извлечь ссылки и URL из PDF
Сохраняйте полезные веб-ссылки, не открывая их по одной.
Английская озвучка
Смотреть видео