Otvorte Extrahovať odkazy z PDF pre zber hodnôt z jedného PDF bez ich kopírovania riadok po riadku. Porovnanie využíva skutočný ukážkový dokument a CSV stiahnuté z nástroja. Trojstranová ukážka vytvorí 4 unikátnych webových adries z 5 výskytov.
Otvorte svoje PDF
Nahrajte jeden PDF súbor alebo vyberte Vyskúšať ukážku pre sledovanie tohto príkladu. Zobrazí sa náhľad PDF a miniatúry strán. Váš pôvodný súbor zostane nezmenený a extrakcia prebehne vo vašom prehliadači.
Textový adresár, správa, výskumná práca alebo brožúra sú užitočným východiskovým bodom. Skenované dokumenty obsahujúce iba obrázky vyžadujú OCR, aby bolo možné rozpoznať ich tlačený text.
Vyberte užitočné možnosti
Na telefóne otvorte Nastavenia. Na počítači použite panel nastavení vedľa náhľadu.
Ponechajte Odstrániť duplikáty zapnuté pre zoskupenie opakujúcich sa cieľov. Zvoľte CSV, ak potrebujete referencie na strany, alebo TXT pre jednoduchý zoznam URL. Príklad používa predvolený formát CSV a poradie podľa zdroja.
Extrahujte a skontrolujte zhody
Vyberte Extrahovať. Po dokončení spracovania karta Výsledky zobrazí hodnoty, počty výskytov a zdrojové strany. Vyberte krúžok s číslom strany pre kontrolu jej umiestnenia v náhľade PDF, potom sa vráťte k Výsledkom.
Ukážka obsahuje https://example.org/events dvakrát a tri ďalšie webové adresy. Tiež demonštruje klikateľný odkaz, ktorého viditeľný štítok je odlišný od jeho cieľa. Tlačená URL a jej identický klikateľný cieľ na tej istej strane sa nepočítajú dvakrát.
Použite Filtrovať výsledky pre zúženie zoznamu. Kopírovanie a sťahovanie zahŕňa všetky zodpovedajúce riadky, aj keď výsledná tabuľka presahuje niekoľko obrazoviek.
Stiahnite CSV alebo TXT
Vyberte Stiahnuť CSV, potom použite hlavné tlačidlo Stiahnuť na obrazovke pripravenosti. CSV obsahuje stĺpce Typ, Hodnota, Počet a Strany. TXT a Kopírovať všetko obsahujú jednu hodnotu na riadok.
Hodnoty v CSV, ktoré by mohli byť interpretované ako tabuľkové vzorce, sú chránené úvodným apostrofom. Napríklad medzinárodné telefónne číslo začína znakom plus. Použite TXT, ak potrebujete čistý zoznam bez ochrany pre tabuľkové procesory.
Časté otázky
Dokáže toto nájsť odkaz za slovami ako „Čítať viac“?
Áno, ak majú tieto slová v PDF podporovanú anotáciu odkazu HTTP alebo HTTPS. Exportovanou hodnotou je ich webový cieľ. Samotné vizuálne podčiarknutie nedokazuje, že existuje klikateľný odkaz.
Čo mám robiť so skenovaným PDF?
Najprv spustite PDF OCR, potom nahrajte rozpoznanú kópiu do tohto nástroja. Výstup OCR starostlivo skontrolujte: chybný znak môže zmeniť adresu alebo identifikátor.
Aké sú limity extrakcie?
Použite jeden PDF súbor do 50 MiB a 750 strán. Extrakcia je obmedzená na 20,000 zhôd celkovo a 2,000 na stranu, s časovým limitom spracovania 90 sekúnd. Platia aj limity pre text a anotácie. Ak limit alebo nečitateľná strana preruší skenovanie, nástroj zobrazí upozornenie na čiastočné výsledky a označí názov exportovaného súboru ako čiastočný.
Otvárajú sa moje PDF odkazy automaticky?
Nie. Extrakcia číta súbor v prehliadači a nenavštevuje extrahované ciele. Tlačidlá strán navigujú v rámci náhľadu PDF.
Ponechajte si hodnoty a ich kontext
Extrahujte zameraný zoznam, skontrolujte zdrojové strany a stiahnite formát, ktorý vyhovuje vášmu ďalšiemu kroku.

