Nástroje150

Užitočná úloha s PDF, jednoducho vyriešená

Extrahovať údaje z PDF.

Nájdite údaje, ktoré potrebujete. Pri každom výsledku si zachovajte zdrojovú stránku.

Advertisements
Váš pracovný priestor pre PDF
Vo vašom zariadení
alebo sem presuňte svoje súbory
Váš PDF súbor sa spracováva v tomto prehliadači. PDF
Advertisements

Ako extrahovať údaje z PDF

  1. 01

    Vyberte jeden PDF súbor

    Nahrajte dokument s textom, ktorý možno vybrať, alebo vyskúšajte ukážku.

  2. 02

    Extrahovať a skontrolovať

    Vyberte Extrahovať. Skontrolujte hodnoty, počty a zdrojové strany; filtrujte alebo zoraďte zoznam.

  3. 03

    Kopírovať alebo stiahnuť

    Skopírujte hodnoty alebo stiahnite CSV s odkazmi na strany či jednoduchý zoznam TXT.

BlogAko extrahovať štruktúrované údaje z PDFPrečítať príručku

Extrahovať štruktúrované hodnoty z PDF do CSV alebo textu

Vyberte typy údajov, ktoré potrebujete: e-maily, telefónne čísla, URL, číselné dátumy, IPv4 adresy, domény, DOI, ISBN, hashtagy a MAC adresy. Skontrolujte extrahované hodnoty s počtami a odkazmi na stránky.

Rozpoznané hodnoty sa stanú zoznamom s odkazmi na zdrojové stránky.
RÝCHLY VIDEO NÁVOD Ako extrahovať štruktúrované údaje z PDF Zhromaždite kontakty a výskumné identifikátory do jedného organizovaného zoznamu. Anglický komentár Pozrieť video

Ako extrahovať štruktúrované údaje z PDF

Kedy je to užitočné?

Výskum

Zhromažďovanie identifikátorov

Zhromaždite hodnoty DOI a ISBN spolu so stránkami, na ktorých sa objavujú.

Správy

Vytiahnutie číselných údajov

Nájdite datované záznamy a IPv4 adresy.

Adresáre

Vytvorte si zoznam kontaktov

Skombinujte e-maily, telefónne čísla a webové odkazy do jedného štruktúrovaného exportu.

Funkcie a ovládacie prvky

Vyberte užitočné typy údajov

Začnite s e-mailmi, telefónmi a URL, potom otvorte Viac typov údajov pre špecializované hodnoty.

Čo podporujú rozpoznávače

Dátumy musia používať číselný formát so štvorciferným rokom; nejednoznačné hodnoty dňa/mesiaca si zachovávajú svoje zdrojové poradie. Oktety IPv4 sú validované; IPv6 nie je zahrnuté.

Domény sú odvodené z rozpoznaných e-mailov a webových odkazov, nie z ľubovoľných názvov súborov. Extrakcia DOI pokrýva bežné moderné formy DOI, nie všetky historické formy. Hodnoty ISBN-13 vyžadujú platný kontrolný súčet; ISBN-10 vyžaduje aj štítok ISBN. Hashtagy môžu obsahovať Unicode znaky, vrátane arabských.

MAC adresy používajú šesť párov oddelených dvojbodkou alebo pomlčkou. Nástroj nikdy nekontaktuje extrahované adresy alebo identifikátory.

Skontrolujte hodnoty spolu s ich zdrojovými stránkami

Skontrolujte počty, prejdite na stranu PDF a filtrujte zoznam výsledkov.

Skontrolujte a usporiadajte

Každý výsledok zaznamenáva fyzickú pozíciu strany v PDF, ktorá sa môže líšiť od vytlačených čísel strán. Vyberte čip strany pre otvorenie náhľadu s približným zvýraznením.

Odstraňovanie duplikátov je predvolene zapnuté. Počty kombinujú rozpoznané opakovania tej istej hodnoty; vypnite túto možnosť, ak chcete vidieť samostatné výskyty. Triedenie podľa abecedy mení poradie zoznamu. Filtrovanie sa vzťahuje na kopírovanie a sťahovanie, ako aj na viditeľné riadky.

Kopírujte hodnoty alebo stiahnite štruktúrovaný zoznam

Zvoľte CSV pre počty a strany, alebo TXT pre jednu hodnotu na riadok.

Čo obsahuje každé stiahnutie

CSV obsahuje stĺpce Typ, Hodnota, Počet a Strany. Kódovanie UTF-8 podporuje arabské a iné písma. Hodnoty, ktoré by mohli byť interpretované ako vzorce tabuľkového procesora, sú pre bezpečnejší import označené apostrofom.

TXT a Kopírovať všetko obsahujú iba hodnoty, jednu na riadok. Zahrnuté sú všetky riadky zodpovedajúce filtru, aj keď tabuľka na obrazovke zahŕňa niekoľko strán výsledkov. Nevytvára sa žiadne nové PDF a zdrojové PDF zostáva nezmenené.

Udržujte veľké extrakcie zvládnuteľné

Spracujte jedno PDF vo svojom prehliadači s explicitnými limitmi a upozorneniami na čiastočné výsledky.

Súbory, limity a skenované strany

Načítajte jedno PDF do veľkosti 50 MiB a 500 strán. Extrakcia kontroluje do 250 000 znakov a 2 000 zhôd na stranu, celkovo 10 miliónov znakov a 20 000 zhôd, a 2 000 anotácií na stranu. Rozpočet 90 sekúnd na extrakciu obmedzuje dlhé úlohy. Veľmi zložité dokumenty môžu fungovať lepšie, ak sú rozdelené na menšie súbory.

Keď sa dosiahne limit alebo stranu nie je možné úplne prečítať, výsledky zobrazia upozornenie a obmedzené alebo neúplné behy sa exportujú s označením partial v názve súboru. Strany bez vyberateľného textu sa počítajú osobitne. Pre skeny obsahujúce iba obrázky použite PDF OCR a potom sa vráťte k extrakcii rozpoznaného textu.

Obsah PDF sa spracováva lokálne v tomto prehliadači. Nahrané dokumenty sa neodosielajú na extrakčný server. Odkazy, e-mailové adresy a telefónne čísla nájdené v PDF sa nikdy automaticky nekontaktujú.

Podporované súbory a spracovanie

Vstup
PDF
Výstup
CSV / TXT

Otvorte jeden PDF súbor do 50 MB a 750 strán. Pre zložité dokumenty môžu platiť dodatočné limity pre výstup, pamäť a spracovanie.

Spracovanie prebieha vo vašom zariadení bez nahratia dokumentu. Výsledok si stiahnite pred zatvorením stránky; originál si ponechajte oddelene.

Advertisements
FAQ

Pár užitočných odpovedí

Vedzte, čo môžete očakávať, skôr než začnete.

Vo vašom zariadení
Čo dokáže tento nástroj rozpoznať?

Vyberte si dátové typy, ktoré potrebujete: e-maily, telefónne čísla, URL, číselné dátumy, IPv4 adresy, domény, DOI, ISBN, hashtagy a MAC adresy. Skontrolujte extrahované hodnoty s počtami a odkazmi na strany. Toto extrahuje rozpoznateľné hodnoty, nie tabuľky, faktúry alebo sémantické polia. Vzory a kontrolné súčty znižujú šum, ale nezaručujú úplnosť ani nedokazujú, že identifikátor je pravý.

Môžem extrahovať údaje zo skenovaných PDF?

Číta sa iba vyberateľný text a rozpoznané ciele odkazov. Strany obsahujúce iba obrázky vyžadujú najprv PDF OCR. Spustite OCR, stiahnite si prehľadávateľné PDF a potom sa vráťte k tomuto extraktoru.

Ako sa zaobchádza s duplicitami a počtami?

Odstránenie duplicít kombinuje rozpoznané ekvivalentné hodnoty. Počet zobrazuje zistené výskyty a Strany uvádzajú fyzické pozície strán v PDF. Vypnite túto možnosť, ak chcete ponechať výskyty oddelené. Vytlačený cieľ a zodpovedajúci klikateľný odkaz na tej istej strane sa nepočítajú dvakrát.

Aký je rozdiel medzi CSV a TXT?

CSV obsahuje typ, hodnotu, počet výskytov a odkazy na strany. TXT a Kopírovať všetko poskytujú iba hodnoty, jednu na riadok. Zahrnuté sú všetky riadky zodpovedajúce aktuálnemu filtru, nielen viditeľná strana tabuľky.

Nahráva sa PDF na extrakciu?

Nie. Analýza PDF, vyhľadávanie zhôd a exporty prebiehajú v tomto prehliadači. Pôvodné PDF zostáva nezmenené. Žiadny extrahovaný odkaz, e-mail ani telefónne číslo nie sú automaticky kontaktované.

Aké sú limity?

Jedno PDF do 50 MiB a 500 strán. Extrakcia je obmedzená na 250 000 textových znakov a 2 000 zhôd na stranu, celkovo 10 miliónov znakov a 20 000 zhôd, a 2 000 anotácií na stranu. Výsledky obsahujú upozornenie, ak sú kvôli limitom alebo nečitateľným stranám čiastočné.

Pokračovať

Čo chcete urobiť ďalej?

Vyberte si nástroj. Vaše hotové PDF pôjde s vami.

PDF

Advertisements

Jazyk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina