Otevřete Extrakce odkazů z PDF pro získání hodnot z jednoho PDF bez nutnosti kopírování řádek po řádku. Porovnání využívá skutečný ukázkový dokument a CSV stažené z nástroje. Třístránková ukázka vytvoří 4 unikátní webové adresy z 5 výskytů.
Otevřete své PDF
Nahrajte jedno PDF nebo vyberte Vyzkoušet ukázku pro sledování tohoto příkladu. Zobrazí se náhled PDF a miniatury stran. Váš původní soubor zůstane nezměněn a extrakce proběhne ve vašem prohlížeči.
Textový adresář, zpráva, výzkumná práce nebo brožura jsou užitečným výchozím bodem. Skenované dokumenty obsahující pouze obrázky vyžadují před rozpoznáním tištěného textu OCR.
Zvolte užitečné možnosti
Na telefonu otevřete Nastavení. Na počítači použijte panel nastavení vedle náhledu.
Ponechte Odstranit duplicity zapnuté pro seskupení opakujících se cílů. Zvolte CSV, pokud potřebujete odkazy na strany, nebo TXT pro prostý seznam URL. Příklad používá výchozí formát CSV a pořadí zdrojů.
Extrahujte a zkontrolujte shody
Vyberte Extrahovat. Po dokončení zpracování zobrazí karta Výsledky hodnoty, počty výskytů a zdrojové strany. Vyberte číslo strany v kroužku pro kontrolu jejího umístění v náhledu PDF, poté se vraťte k výsledkům.
Ukázka obsahuje https://example.org/events dvakrát a tři další webové adresy. Také demonstruje klikatelný odkaz, jehož viditelný popisek se liší od cíle. Tištěná URL a její identický klikatelný cíl na stejné straně nejsou počítány dvakrát.
Použijte Filtrovat výsledky pro zúžení seznamu. Kopírování a stahování zahrnuje všechny odpovídající řádky, i když tabulka výsledků přesahuje několik obrazovek.
Stáhněte CSV nebo TXT
Vyberte Stáhnout CSV, poté použijte hlavní tlačítko Stažení na obrazovce připravenosti. CSV obsahuje sloupce Typ, Hodnota, Počet a Stránky. TXT a Kopírovat vše obsahují jednu hodnotu na řádek.
Hodnoty v CSV, které by mohly být interpretovány jako vzorce tabulkového procesoru, jsou chráněny úvodním apostrofem. Například mezinárodní telefonní číslo začíná znaménkem plus. Použijte TXT, pokud potřebujete prostý seznam bez ochrany pro tabulkové procesory.
Časté dotazy
Dokáže toto najít odkaz za slovy jako „Číst více“?
Ano, pokud mají tato slova v PDF podporovanou anotaci odkazu HTTP nebo HTTPS. Exportovanou hodnotou je jejich webový cíl. Pouhé vizuální podtržení nedokazuje, že existuje klikatelný odkaz.
Co mám dělat se skenovaným PDF?
Nejprve spusťte PDF OCR, poté načtěte rozpoznanou kopii do tohoto nástroje. Výstup OCR pečlivě zkontrolujte: chybný znak může změnit adresu nebo identifikátor.
Jaké jsou limity extrakce?
Použijte jedno PDF do velikosti 50 MiB a 750 stran. Extrakce je omezena na celkem 20 000 shod a 2 000 na stranu, s časovým limitem zpracování 90 sekund. Platí také limity pro text a anotace. Pokud limit nebo nečitelná strana přeruší skenování, nástroj zobrazí upozornění na částečné výsledky a označí název exportovaného souboru jako částečný.
Otevírají se mé PDF odkazy automaticky?
Ne. Extrakce čte soubor v prohlížeči a nenavštěvuje extrahované cíle. Tlačítka stran slouží k navigaci v náhledu PDF.
Ponechte si hodnoty a jejich kontext
Extrahujte cílený seznam, zkontrolujte zdrojové strany a stáhněte formát, který vyhovuje vašemu dalšímu kroku.

