Shromažďování identifikátorů
Shromážděte hodnoty DOI a ISBN spolu se stránkami, na kterých se objevují.
Najděte data, která potřebujete. U každého výsledku si ponechte zdrojovou stránku.
| Typ | Hodnota | Počet | Stránky |
|---|
Kopírování a stažení zahrnuje všechny odpovídající řádky napříč všemi stránkami výsledků. CSV obsahuje počty a čísla stran PDF; TXT obsahuje pouze hodnoty.
Vyberte číslo strany ve výsledcích pro kontrolu zdroje. Zvýraznění zobrazují přibližné pozice.
Váš seznam je připraven. Stáhněte si jej nebo se vraťte ke kontrole a změně formátu.
Nahrajte dokument s textem, který lze vybrat, nebo vyzkoušejte ukázku.
Vyberte Extrahovat. Zkontrolujte hodnoty, počty a zdrojové strany; filtrujte nebo seřaďte seznam.
Zkopírujte hodnoty nebo stáhněte CSV s odkazy na strany či jednoduchý seznam TXT.
Vyberte datové typy, které potřebujete: e-maily, telefonní čísla, URL, číselná data, IPv4 adresy, domény, DOI, ISBN, hashtagy a MAC adresy. Zkontrolujte extrahované hodnoty s počty a odkazy na stránky.
Shromážděte hodnoty DOI a ISBN spolu se stránkami, na kterých se objevují.
Najděte datované záznamy a IPv4 adresy.
Zkombinujte e-maily, telefony a webové odkazy do jednoho strukturovaného exportu.
Začněte s e-maily, telefony a URL, poté otevřete Další datové typy pro specializované hodnoty.
Data musí používat číselný formát se čtyřmístným rokem; nejednoznačné hodnoty dne/měsíce si zachovávají své zdrojové pořadí. Oktety IPv4 jsou validovány; IPv6 není zahrnuto.
Domény jsou odvozeny z rozpoznaných e-mailů a webových odkazů, nikoli z libovolných názvů souborů. Extrakce DOI pokrývá běžné moderní formy DOI, nikoli všechny historické formy. Hodnoty ISBN-13 vyžadují platný kontrolní součet; ISBN-10 také vyžaduje štítek ISBN. Hashtagy mohou obsahovat znaky Unicode, včetně arabských.
MAC adresy používají šest párů oddělených dvojtečkami nebo pomlčkami. Nástroj nikdy nekontaktuje extrahované adresy nebo identifikátory.
Zkontrolujte počty, přejděte na stránku PDF a filtrujte seznam výsledků.
Každý výsledek zaznamenává fyzickou pozici stránky v PDF, která se může lišit od tištěných čísel stránek. Výběrem čipu stránky otevřete náhled s přibližným zvýrazněním.
Odstranění duplicit je ve výchozím nastavení zapnuto. Počty kombinují rozpoznaná opakování stejné hodnoty; vypněte jej, chcete-li vidět jednotlivé výskyty. Seřadit abecedně mění pořadí seznamu. Filtrování se vztahuje na kopírování a stahování i na viditelné řádky.
Zvolte CSV pro počty a stránky, nebo TXT pro jednu hodnotu na řádek.
CSV obsahuje sloupce Typ, Hodnota, Počet a Stránky. Kódování UTF-8 podporuje arabštinu a další skripty. Hodnoty, které by mohly být interpretovány jako vzorce tabulkového procesoru, jsou pro bezpečnější import uvozeny apostrofem.
TXT a Kopírovat vše obsahují pouze hodnoty, jednu na řádek. Zahrnuty jsou všechny řádky odpovídající filtru, i když tabulka na obrazovce pokrývá několik stránek výsledků. Nevytváří se žádné nové PDF a zdrojové PDF zůstává nezměněno.
Zpracujte jedno PDF ve svém prohlížeči s explicitními limity a upozorněními na částečné výsledky.
Načtěte jedno PDF do velikosti 50 MiB a 500 stran. Extrakce kontroluje až 250 000 znaků a 2 000 shod na stránku, celkem 10 milionů znaků a 20 000 shod a 2 000 anotací na stránku. Rozpočet 90 sekund na extrakci omezuje zdlouhavé běhy. Velmi složité dokumenty mohou fungovat lépe, pokud jsou rozděleny na menší soubory.
Když je dosaženo limitu nebo stránku nelze plně přečíst, výsledky zobrazí upozornění a omezené nebo neúspěšné běhy exportují s označením partial v názvu souboru. Stránky bez volitelného textu se počítají samostatně. Pro skeny pouze s obrázky použijte PDF OCR a poté se vraťte k extrakci rozpoznaného textu.
Obsah PDF je zpracováván lokálně v tomto prohlížeči. Nahrané dokumenty nejsou odesílány na extrakční server. Odkazy, e-mailové adresy a telefonní čísla nalezená v PDF nejsou nikdy automaticky kontaktována.
Otevřete jeden PDF soubor o velikosti až 50 MB a 750 stranách. U složitých dokumentů mohou platit další limity pro výstup, paměť a zpracování.
Zpracování probíhá ve vašem zařízení bez nahrávání dokumentu. Výsledek si stáhněte před zavřením stránky; originál si ponechte odděleně.
Zjistěte, co očekávat, než začnete.
Ve vašem zařízeníVyberte datové typy, které potřebujete: e-maily, telefonní čísla, adresy URL, číselná data, adresy IPv4, domény, DOI, ISBN, hashtagy a adresy MAC. Zkontrolujte extrahované hodnoty s počty a odkazy na stránky. Nástroj extrahuje rozpoznatelné hodnoty, nikoli tabulky, faktury nebo sémantická pole. Vzory a kontrolní součty snižují šum, ale nezaručují úplnost ani nedokazují, že je identifikátor pravý.
Čte se pouze vybratelný text a rozpoznané cíle odkazů. Stránky obsahující pouze obrázky vyžadují nejprve OCR PDF. Spusťte OCR, stáhněte si prohledávatelné PDF a poté se vraťte k tomuto extraktoru.
Odstranění duplicit kombinuje rozpoznané ekvivalentní hodnoty. Počet ukazuje zjištěné výskyty a Stránky uvádějí fyzické pozice stránek v PDF. Vypnutím této možnosti ponecháte výskyty oddělené. Tištěný cíl a odpovídající klikatelný odkaz na stejné stránce se nepočítají dvakrát.
CSV obsahuje typ, hodnotu, počet výskytů a odkazy na stránky. TXT a Kopírovat vše poskytují pouze hodnoty, jednu na řádek. Zahrnuty jsou všechny řádky odpovídající aktuálnímu filtru, nejen viditelná stránka tabulky.
Ne. Analýza PDF, shoda a exporty probíhají v tomto prohlížeči. Původní PDF zůstává nezměněno. Žádný extrahovaný odkaz, e-mail nebo telefonní číslo není automaticky kontaktováno.
Jedno PDF do velikosti 50 MiB a 500 stran. Extrakce je omezena na 250 000 znaků textu a 2 000 shod na stránku, celkem 10 milionů znaků a 20 000 shod, a 2 000 anotací na stránku. Výsledky obsahují upozornění, pokud jsou kvůli limitům nebo nečitelným stránkám neúplné.
RYCHLÝ VIDEO TUTORIÁL
Jak extrahovat strukturovaná data z PDF
Shromážděte kontakty a výzkumné identifikátory do jednoho organizovaného seznamu.
Anglický komentář
Sledovat video