Otvorte Extrahovať údaje z PDF na zhromaždenie hodnôt z jedného PDF bez ich kopírovania riadok po riadku. Porovnanie využíva skutočný vzorový dokument a CSV stiahnuté z nástroja. S vybranými e-mailmi, telefónmi, URL adresami, DOI, ISBN a IPv4 vytvorí trojstranová vzorka 11 unikátnych riadkov z 15 výskytov.
Otvorte svoj PDF súbor
Nahrajte jeden PDF súbor alebo vyberte Vyskúšať vzorku a postupujte podľa tohto príkladu. Zobrazí sa náhľad PDF a miniatúry strán. Váš pôvodný súbor zostane nezmenený a extrakcia prebehne vo vašom prehliadači.
Textový adresár, správa, výskumná práca alebo brožúra sú užitočným východiskovým bodom. Skenované dokumenty obsahujúce iba obrázky vyžadujú pred rozpoznaním tlačeného textu OCR.
Vyberte užitočné možnosti
V telefóne otvorte Nastavenia. Na počítači použite panel nastavení vedľa náhľadu.
V časti Čo extrahovať sú e-maily, telefónne čísla a URL adresy vybrané predvolene. Otvorte Ďalšie typy údajov a vyberte aj DOI, ISBN a IPv4 adresy. Ponechajte zapnuté odstránenie duplikátov a zvoľte CSV.
Extrahujte a skontrolujte zhody
Vyberte Extrahovať. Po dokončení spracovania karta Výsledky zobrazí hodnoty, počty výskytov a zdrojové strany. Vyberte číslo strany v krúžku, aby ste skontrolovali jej umiestnenie v náhľade PDF, a potom sa vráťte k výsledkom.
Výstup kombinuje zoznam kontaktov s DOI 10.1000/182, ISBN 978-0-306-40615-7 a IPv4 adresou 192.0.2.10 zo strany 2. Stĺpec Typ identifikuje každú hodnotu. Pred kopírovaním alebo stiahnutím menšej podmnožiny filtrujte podľa relevantného slova alebo identifikátora.
Použite Filtrovať výsledky na zúženie zoznamu. Kopírovanie a sťahovanie zahŕňa všetky zodpovedajúce riadky, aj keď výsledná tabuľka presahuje niekoľko obrazoviek.
Stiahnite si CSV alebo TXT
Vyberte Stiahnuť CSV, potom použite hlavné tlačidlo Stiahnuť na obrazovke pripravenosti. CSV obsahuje stĺpce Typ, Hodnota, Počet a Strany. TXT a Kopírovať všetko obsahujú jednu hodnotu na riadok.
Hodnoty CSV, ktoré by mohli byť interpretované ako tabuľkové vzorce, sú chránené úvodným apostrofom. Napríklad medzinárodné telefónne číslo začína znakom plus. Ak potrebujete čistý zoznam bez ochrany tabuľkového procesora, použite TXT.
Časté otázky
Extrahuje to akékoľvek číslo alebo každý identifikátor?
Nie. Každá vybraná kategória má svoje vlastné pravidlá rozpoznávania. IPv6, percentá, ceny a čísla platobných kariet sa neextrahujú. Skontrolujte zhody so zdrojom; platný formát nemôže potvrdiť, že kontakt alebo identifikátor existuje.
Čo mám robiť so skenovaným PDF?
Najprv spustite PDF OCR, potom načítajte rozpoznanú kópiu do tohto nástroja. Výstup OCR starostlivo skontrolujte: chybný znak môže zmeniť adresu alebo identifikátor.
Aké sú limity extrakcie?
Použite jeden PDF súbor do 50 MiB a 750 strán. Extrakcia je obmedzená na 20,000 zhôd celkovo a 2,000 na stranu, s časovým limitom spracovania 90 sekúnd. Platia aj limity pre text a anotácie. Ak limit alebo nečitateľná strana preruší skenovanie, nástroj zobrazí upozornenie na čiastočné výsledky a označí názov exportovaného súboru ako čiastočný.
Otvárajú sa moje PDF odkazy automaticky?
Nie. Extrakcia číta súbor v prehliadači a nenavštevuje extrahované ciele. Tlačidlá strán navigujú v rámci náhľadu PDF.
Ponechajte si hodnoty a ich kontext
Extrahujte cielený zoznam, skontrolujte zdrojové strany a stiahnite si formát, ktorý vyhovuje vášmu ďalšiemu kroku.

