Инструменти150

Полезна PDF задача, направена лесно

Извличане на имейли от PDF.

Превърнете данните за контакт във вашия PDF в чист списък с имейли.

Advertisements
Вашето PDF работно пространство
На вашето устройство
или пуснете файловете си тук
Вашият PDF се обработва в този браузър. PDF
Advertisements

Как да извлечем имейл адреси от PDF

  1. 01

    Изберете един PDF

    Заредете документ с избираем текст или опитайте примерния файл.

  2. 02

    Извличане и преглед

    Изберете Извличане. Прегледайте стойностите, броя срещания и изходните страници; филтрирайте или сортирайте списъка.

  3. 03

    Копиране или изтегляне

    Копирайте стойностите или изтеглете CSV с препратки към страници или обикновен TXT списък.

БлогКак да извлечем имейл адреси от PDFПрочетете ръководството

Извличане на имейл адреси от директории и отчети

Превърнете избираемия текст за контакти в един PDF в списък с имейли за повторна употреба. Разпознатите адреси включват конвенционален имейл текст и цели на mailto връзки. Прегледайте броя и изходните страници преди копиране или изтегляне.

Разпознатите стойности се превръщат в списък с препратки към изходни страници.
КРАТЪК ВИДЕО УРОК Как да извлечем имейл адреси от PDF Превърнете разпръснатите данни за контакт в чист списък с имейли. Английски разказ Гледайте видеото

Как да извлечем имейл адреси от PDF

Кога е полезно това?

Директории

Събиране на адреси за контакти

Превърнете директория с членове или събития в списък с препратки към страници.

Проучвания

Събиране на контакти на автори

Намиране на адреси за кореспонденция в документи, автобиографии или отчети.

Дълги PDF файлове

Избягване на многократно копиране

Групирайте повторени адреси и проверете колко често се появяват.

Функции и контроли

Разпознаване на имейл адреси

Събирайте адреси от текст и имейл връзки.

Поддържани имейл формати

Екстракторът търси конвенционални адреси от типа local-part@domain, включително тагове с плюс и имена с точки. Приема интернационализирани имена на домейни, но не и не-ASCII имена на пощенски кутии, цитирани локални части или умишлено обфускирани адреси.

Адресите се сравняват без отчитане на малки и големи букви при премахване на дубликати. Идентичен видим адрес и mailto цел на една и съща страница не се броят два пъти само защото текстът е кликаем. Повредените карти на символи в PDF и адресите, пренесени на нов ред, може да изискват ръчна проверка.

Преглед на стойностите с техните изходни страници

Проверявайте броя, прескачайте към страница от PDF и филтрирайте списъка с резултати.

Преглед и организиране

Всеки резултат записва физическата позиция на страницата в PDF файла, която може да се различава от отпечатаните номера на страници. Изберете чип на страница, за да отворите визуализацията с приблизително маркиране.

Премахването на дубликати е включено по подразбиране. Броячите комбинират разпознати повторения на една и съща стойност; изключете го, за да видите отделните срещания. Сортирането по азбучен ред променя подредбата на списъка. Филтрирането се прилага както за копиране и изтегляне, така и за видимите редове.

Копиране на стойности или изтегляне на структуриран списък

Изберете CSV за брой и страници или TXT за една стойност на ред.

Какво съдържа всяко изтегляне

CSV съдържа колони Тип, Стойност, Брой и Страници. UTF-8 кодирането поддържа арабски и други скриптове. Стойностите, които могат да бъдат интерпретирани като формули за електронни таблици, са с префикс апостроф за по-безопасно импортиране.

TXT и „Копирай всичко“ съдържат само стойности, по една на ред. Всички редове, съответстващи на филтъра, са включени, дори когато таблицата на екрана обхваща няколко страници с резултати. Не се създава нов PDF файл и изходният PDF остава непроменен.

Поддържане на големи извличания в управляем вид

Обработвайте един PDF файл във вашия браузър с изрични ограничения и известия за частични резултати.

Файлове, ограничения и сканирани страници

Заредете един PDF файл до 50 MiB и 500 страници. Извличането проверява до 250 000 знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Бюджет от 90 секунди за извличане ограничава дългите процеси. Много сложни документи може да работят по-добре, ако бъдат разделени на по-малки файлове.

Когато се достигне ограничение или страница не може да бъде прочетена напълно, резултатите показват известие, а ограничените или неуспешните изпълнения се експортират с „partial“ в името на файла. Страниците без избираем текст се броят отделно. Използвайте PDF OCR за сканирания само с изображения, след което се върнете, за да извлечете разпознатия текст.

PDF съдържанието се обработва локално в този браузър. Качените документи не се изпращат до сървър за извличане. Връзките, имейл адресите и телефонните номера, намерени в PDF файла, никога не се свързват автоматично.

Поддържани файлове и обработка

Вход
PDF
Изход
CSV / TXT

Отворете един PDF файл до 50 MB и 750 страници. За сложни документи могат да се прилагат допълнителни ограничения за изход, памет и обработка.

Обработката се извършва на вашето устройство, без да се качва документът. Изтеглете резултата, преди да затворите страницата; съхранявайте оригинала отделно.

Advertisements
ЧЗВ

Няколко полезни отговора

Знайте какво да очаквате, преди да започнете.

На вашето устройство
Какво може да разпознае този инструмент?

Превърнете избираемия текст за контакти в един PDF файл в списък с имейли за повторна употреба. Разпознатите адреси включват конвенционален имейл текст и цели на mailto връзки. Прегледайте броя и изходните страници, преди да копирате или изтеглите. Сканираните страници и обфускираните адреси като name [at] example [dot] org се нуждаят от подготовка. Този инструмент не проверява доставката, собствеността или съгласието за контакт с когото и да било.

Мога ли да извличам данни от сканирани PDF файлове?

Чете се само избираем текст и разпознати цели на връзки. Страниците, съдържащи само изображения, се нуждаят първо от PDF OCR. Изпълнете OCR, изтеглете PDF файла с възможност за търсене и след това се върнете към този екстрактор.

Как се обработват дубликатите и броячите?

Премахването на дубликати комбинира разпознати еквивалентни стойности. Броячът показва засечените срещания, а „Страници“ изброява физическите позиции на страниците в PDF файла. Деактивирайте опцията, за да запазите срещанията отделно. Отпечатана цел и съответстваща кликаема връзка на една и съща страница не се броят два пъти.

Каква е разликата между CSV и TXT?

CSV включва тип, стойност, брой срещания и препратки към страници. TXT и „Копирай всичко“ предоставят само стойностите, по една на ред. Включени са всички редове, съответстващи на текущия филтър, а не само видимата страница на таблицата.

Качва ли се PDF файлът за извличане?

Не. Анализирането, съпоставянето и експортирането на PDF се извършват в този браузър. Оригиналният PDF файл остава непроменен. Нито една извлечена връзка, имейл или телефонен номер не се свързва автоматично.

Какви са ограниченията?

Един PDF файл до 50 MiB и 500 страници. Извличането е ограничено до 250 000 текстови знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Резултатите съдържат известие, ако ограниченията или нечетимите страници ги правят частични.

Продължете

Какво бихте искали да направите след това?

Изберете инструмент. Вашият готов PDF ще бъде с вас.

PDF

Advertisements

език38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina