Nástroje150

Užitečná úloha s PDF, jednoduše

Extrakce e-mailů z PDF.

Proměňte kontaktní údaje ve vašem PDF na čistý seznam e-mailů.

Advertisements
Váš pracovní prostor pro PDF
Ve vašem zařízení
nebo sem přetáhněte soubory
Vaše PDF je zpracováváno v tomto prohlížeči. PDF
Advertisements

Jak extrahovat e-maily z PDF

  1. 01

    Vyberte jedno PDF

    Nahrajte dokument s textem, který lze vybrat, nebo vyzkoušejte ukázku.

  2. 02

    Extrahovat a zkontrolovat

    Vyberte Extrahovat. Zkontrolujte hodnoty, počty a zdrojové strany; filtrujte nebo seřaďte seznam.

  3. 03

    Kopírovat nebo stáhnout

    Zkopírujte hodnoty nebo stáhněte CSV s odkazy na strany či jednoduchý seznam TXT.

BlogJak extrahovat e-mailové adresy z PDFPřečíst příručku

Extrakce e-mailových adres z adresářů a reportů

Převeďte vybratelný text kontaktů v PDF na opakovaně použitelný e-mailový seznam. Rozpoznané adresy zahrnují běžný e-mailový text i cíle odkazů mailto. Před kopírováním nebo stažením zkontrolujte počty a zdrojové stránky.

Rozpoznané hodnoty se stanou seznamem s odkazy na zdrojové stránky.
RYCHLÝ VIDEO TUTORIÁL Jak extrahovat e-mailové adresy z PDF Proměňte roztroušené kontaktní údaje v čistý e-mailový seznam. Anglický komentář Sledovat video

Jak extrahovat e-mailové adresy z PDF

Kdy je to užitečné?

Adresáře

Shromažďování kontaktních adres

Převeďte adresář členů nebo událostí na seznam s odkazy na stránky.

Výzkum

Shromažďování kontaktů na autory

Najděte korespondenční adresy v dokumentech, životopisech nebo zprávách.

Dlouhá PDF

Vyhněte se opakovanému kopírování

Seskupte opakované adresy a zkontrolujte, jak často se objevují.

Funkce a ovládací prvky

Rozpoznat e-mailové adresy

Sbírejte adresy z textu a e-mailových odkazů.

Podporované formáty e-mailů

Extraktor hledá konvenční adresy local-part@domain, včetně plusových značek a tečkovaných jmen. Přijímá internacionalizovaná doménová jména, ale ne ne-ASCII názvy schránek, citované lokální části nebo záměrně maskované adresy.

Adresy jsou při odstraňování duplicit porovnávány bez ohledu na velikost písmen. Identická viditelná adresa a cíl mailto na stejné stránce nejsou počítány dvakrát jen proto, že je text klikatelný. Poškozené mapy znaků PDF a adresy zalomené přes řádky mohou vyžadovat ruční kontrolu.

Kontrola hodnot se zdrojovými stránkami

Zkontrolujte počty, přejděte na stránku PDF a filtrujte seznam výsledků.

Kontrola a organizace

Každý výsledek zaznamenává fyzickou pozici stránky v PDF, která se může lišit od tištěných čísel stránek. Výběrem čipu stránky otevřete náhled s přibližným zvýrazněním.

Odstranění duplicit je ve výchozím nastavení zapnuto. Počty kombinují rozpoznaná opakování stejné hodnoty; vypněte jej, chcete-li vidět jednotlivé výskyty. Seřadit abecedně mění pořadí seznamu. Filtrování se vztahuje na kopírování a stahování i na viditelné řádky.

Zkopírujte hodnoty nebo stáhněte strukturovaný seznam

Zvolte CSV pro počty a stránky, nebo TXT pro jednu hodnotu na řádek.

Co obsahuje každé stažení

CSV obsahuje sloupce Typ, Hodnota, Počet a Stránky. Kódování UTF-8 podporuje arabštinu a další skripty. Hodnoty, které by mohly být interpretovány jako vzorce tabulkového procesoru, jsou pro bezpečnější import uvozeny apostrofem.

TXT a Kopírovat vše obsahují pouze hodnoty, jednu na řádek. Zahrnuty jsou všechny řádky odpovídající filtru, i když tabulka na obrazovce pokrývá několik stránek výsledků. Nevytváří se žádné nové PDF a zdrojové PDF zůstává nezměněno.

Udržujte velké extrakce zvládnutelné

Zpracujte jedno PDF ve svém prohlížeči s explicitními limity a upozorněními na částečné výsledky.

Soubory, limity a skenované stránky

Načtěte jedno PDF do velikosti 50 MiB a 500 stran. Extrakce kontroluje až 250 000 znaků a 2 000 shod na stránku, celkem 10 milionů znaků a 20 000 shod a 2 000 anotací na stránku. Rozpočet 90 sekund na extrakci omezuje zdlouhavé běhy. Velmi složité dokumenty mohou fungovat lépe, pokud jsou rozděleny na menší soubory.

Když je dosaženo limitu nebo stránku nelze plně přečíst, výsledky zobrazí upozornění a omezené nebo neúspěšné běhy exportují s označením partial v názvu souboru. Stránky bez volitelného textu se počítají samostatně. Pro skeny pouze s obrázky použijte PDF OCR a poté se vraťte k extrakci rozpoznaného textu.

Obsah PDF je zpracováván lokálně v tomto prohlížeči. Nahrané dokumenty nejsou odesílány na extrakční server. Odkazy, e-mailové adresy a telefonní čísla nalezená v PDF nejsou nikdy automaticky kontaktována.

Podporované soubory a zpracování

Vstup
PDF
Výstup
CSV / TXT

Otevřete jeden PDF soubor o velikosti až 50 MB a 750 stranách. U složitých dokumentů mohou platit další limity pro výstup, paměť a zpracování.

Zpracování probíhá ve vašem zařízení bez nahrávání dokumentu. Výsledek si stáhněte před zavřením stránky; originál si ponechte odděleně.

Advertisements
Časté dotazy

Pár užitečných odpovědí

Zjistěte, co očekávat, než začnete.

Ve vašem zařízení
Co tento nástroj dokáže rozpoznat?

Převeďte vybratelný kontaktní text v jednom PDF na opakovaně použitelný seznam e-mailů. Rozpoznané adresy zahrnují běžný e-mailový text a cíle odkazů mailto. Před kopírováním nebo stažením zkontrolujte počty a zdrojové stránky. Skenované stránky a maskované adresy, jako je name [at] example [dot] org, vyžadují přípravu. Tento nástroj neověřuje doručitelnost, vlastnictví ani souhlas s kontaktováním kohokoli.

Mohu extrahovat data ze skenovaných PDF?

Čte se pouze vybratelný text a rozpoznané cíle odkazů. Stránky obsahující pouze obrázky vyžadují nejprve OCR PDF. Spusťte OCR, stáhněte si prohledávatelné PDF a poté se vraťte k tomuto extraktoru.

Jak se nakládá s duplicitami a počty?

Odstranění duplicit kombinuje rozpoznané ekvivalentní hodnoty. Počet ukazuje zjištěné výskyty a Stránky uvádějí fyzické pozice stránek v PDF. Vypnutím této možnosti ponecháte výskyty oddělené. Tištěný cíl a odpovídající klikatelný odkaz na stejné stránce se nepočítají dvakrát.

Jaký je rozdíl mezi CSV a TXT?

CSV obsahuje typ, hodnotu, počet výskytů a odkazy na stránky. TXT a Kopírovat vše poskytují pouze hodnoty, jednu na řádek. Zahrnuty jsou všechny řádky odpovídající aktuálnímu filtru, nejen viditelná stránka tabulky.

Je PDF nahráno pro extrakci?

Ne. Analýza PDF, shoda a exporty probíhají v tomto prohlížeči. Původní PDF zůstává nezměněno. Žádný extrahovaný odkaz, e-mail nebo telefonní číslo není automaticky kontaktováno.

Jaká jsou omezení?

Jedno PDF do velikosti 50 MiB a 500 stran. Extrakce je omezena na 250 000 znaků textu a 2 000 shod na stránku, celkem 10 milionů znaků a 20 000 shod, a 2 000 anotací na stránku. Výsledky obsahují upozornění, pokud jsou kvůli limitům nebo nečitelným stránkám neúplné.

Pokračovat

Co byste chtěli dělat dál?

Vyberte nástroj. Vaše hotové PDF jde s vámi.

PDF

Advertisements

Jazyk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina