Инструменты150

Полезная задача для PDF, сделанная просто

Извлечение Email из PDF.

Превратите контактные данные в вашем PDF в чистый список Email.

Advertisements
Ваше рабочее пространство PDF
На вашем устройстве
или перетащите файлы сюда
Ваш PDF обрабатывается в этом браузере. PDF
Advertisements

Как извлечь адреса электронной почты из PDF

  1. 01

    Выберите один PDF

    Загрузите документ с текстовым слоем или попробуйте образец.

  2. 02

    Извлечение и проверка

    Выберите «Извлечь». Проверьте значения, количество и исходные страницы; отфильтруйте или отсортируйте список.

  3. 03

    Копирование или скачивание

    Скопируйте значения или скачайте CSV со ссылками на страницы, либо простой список TXT.

БлогКак извлечь адреса электронной почты из PDFЧитать руководство

Извлечение адресов электронной почты из справочников и отчетов

Превратите выделяемый контактный текст в PDF в список адресов электронной почты. Распознаются как обычные адреса, так и цели ссылок mailto. Проверяйте количество и исходные страницы перед копированием или скачиванием.

Распознанные значения становятся списком со ссылками на исходные страницы.
КРАТКИЙ ВИДЕОУРОК Как извлечь адреса электронной почты из PDF Превратите разрозненные контактные данные в аккуратный список email. Английская озвучка Смотреть видео

Как извлечь адреса электронной почты из PDF

Когда это полезно?

Справочники

Сбор контактных адресов

Превратите справочник участников или мероприятий в список со ссылками на страницы.

Исследования

Сбор контактов авторов

Найдите адреса для переписки в статьях, резюме или отчетах.

Длинные PDF-файлы

Избегайте повторного копирования

Группируйте повторяющиеся адреса и проверяйте частоту их появления.

Функции и элементы управления

Распознавание адресов электронной почты

Собирайте адреса из текста и ссылок электронной почты.

Поддерживаемые форматы электронной почты

Экстрактор ищет обычные адреса local-part@domain, включая теги с плюсом и имена с точками. Он принимает интернационализированные доменные имена, но не почтовые имена, не содержащие ASCII, кавычки в локальной части или намеренно запутанные адреса.

Адреса сравниваются без учета регистра при удалении дубликатов. Идентичный видимый адрес и цель mailto на одной странице не считаются дважды только потому, что текст является кликабельным. Поврежденные карты символов PDF и адреса, перенесенные на несколько строк, могут потребовать ручной проверки.

Просмотр значений вместе с исходными страницами

Проверяйте количество, переходите к странице PDF и фильтруйте список результатов.

Просмотр и систематизация

Каждый результат записывает физическое положение страницы в PDF, которое может отличаться от напечатанных номеров страниц. Выберите чип страницы, чтобы открыть предварительный просмотр с приблизительной подсветкой.

Удаление дубликатов включено по умолчанию. Количество объединяет распознанные повторения одного и того же значения; выключите эту функцию, чтобы увидеть отдельные вхождения. Сортировка по алфавиту меняет порядок списка. Фильтрация применяется как к копированию и скачиванию, так и к видимым строкам.

Копирование значений или скачивание структурированного списка

Выберите CSV для количества и страниц или TXT для одного значения в строке.

Что содержит каждое скачивание

CSV содержит столбцы Тип, Значение, Количество и Страницы. Кодировка UTF-8 поддерживает арабский и другие языки. Значения, которые могут быть интерпретированы как формулы электронных таблиц, предваряются апострофом для более безопасного импорта.

TXT и «Копировать все» содержат только значения, по одному в строке. Включаются все строки, соответствующие фильтру, даже если таблица на экране занимает несколько страниц результатов. Новый PDF не создается, а исходный PDF остается без изменений.

Управление большими объемами извлеченных данных

Обрабатывайте один PDF в своем браузере с явными ограничениями и уведомлениями о частичных результатах.

Файлы, ограничения и отсканированные страницы

Загрузите один PDF размером до 50 МБ и до 500 страниц. Извлечение проверяет до 250 000 символов и 2 000 совпадений на страницу, 10 миллионов символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Бюджет времени на извлечение в 90 секунд ограничивает длительные процессы. Очень сложные документы могут лучше обрабатываться при разделении на файлы меньшего размера.

Когда предел достигнут или страница не может быть полностью прочитана, результаты показывают уведомление, а ограниченные или неудачные запуски экспортируются с пометкой partial в имени файла. Страницы без выделяемого текста считаются отдельно. Используйте PDF OCR для сканированных изображений, затем вернитесь, чтобы извлечь распознанный текст.

Содержимое PDF обрабатывается локально в этом браузере. Загруженные документы не отправляются на сервер извлечения. Ссылки, адреса электронной почты и номера телефонов, найденные внутри PDF, никогда не запрашиваются автоматически.

Поддерживаемые файлы и обработка

Входные данные
PDF
Выходные данные
CSV / TXT

Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.

Обработка происходит на вашем устройстве без загрузки документа. Скачайте результат перед закрытием страницы; сохраните оригинал отдельно.

Advertisements
FAQ

Полезные ответы

Узнайте, чего ожидать, прежде чем начать.

На вашем устройстве
Что может распознать этот инструмент?

Превращайте выделяемый контактный текст в одном PDF в список адресов электронной почты, готовый к использованию. Распознанные адреса включают обычный текст email и цели ссылок mailto. Проверяйте количество и исходные страницы перед копированием или скачиванием. Отсканированные страницы и замаскированные адреса, такие как name [at] example [dot] org, требуют предварительной подготовки. Этот инструмент не проверяет доставку, право собственности или согласие на контакт.

Можно ли извлекать данные из отсканированных PDF?

Считывается только выделяемый текст и распознанные цели ссылок. Страницы, состоящие только из изображений, требуют предварительного OCR. Выполните OCR, скачайте PDF с возможностью поиска, а затем вернитесь к этому инструменту извлечения.

Как обрабатываются дубликаты и количество?

Функция удаления дубликатов объединяет распознанные эквивалентные значения. Столбец «Количество» показывает число обнаруженных вхождений, а «Страницы» — физические номера страниц PDF. Отключите эту опцию, чтобы сохранить вхождения раздельно. Печатный текст ссылки и соответствующая кликабельная ссылка на одной странице не считаются дважды.

В чем разница между CSV и TXT?

CSV включает тип, значение, количество вхождений и ссылки на страницы. TXT и функция «Копировать все» предоставляют только значения, по одному в строке. Включаются все строки, соответствующие текущему фильтру, а не только видимая страница таблицы.

Загружается ли PDF для извлечения?

Нет. Разбор PDF, сопоставление и экспорт выполняются в этом браузере. Исходный PDF остается без изменений. Ни одна извлеченная ссылка, адрес электронной почты или номер телефона не запрашивается автоматически.

Какие существуют ограничения?

Один PDF объемом до 50 MiB и до 500 страниц. Извлечение ограничено 250 000 текстовых символов и 2 000 совпадений на страницу, 10 миллионами символов и 20 000 совпадений в целом, а также 2 000 аннотаций на страницу. Результаты будут содержать уведомление, если из-за ограничений или нечитаемых страниц данные оказались неполными.

Продолжить

Что вы хотите сделать дальше?

Выберите инструмент. Ваш готовый PDF останется с вами.

PDF

Advertisements

Язык38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina