Zbiranje identifikatorjev
Zberite vrednosti DOI in ISBN s stranmi, na katerih se pojavljajo.
Poiščite podatke, ki jih potrebujete. Ohranite izvorno stran za vsak rezultat.
| Vrsta | Vrednost | Število | Strani |
|---|
Kopiranje in prenos vključujeta vse ujemajoče se vrstice na vseh straneh z rezultati. CSV vključuje število pojavitev in številke strani PDF; TXT vsebuje samo vrednosti.
V rezultatih izberite številko strani za preverjanje vira. Označbe prikazujejo približne položaje.
Vaš seznam je pripravljen. Prenesite ga ali se vrnite za pregled in spremembo formata.
Naložite dokument z besedilom, ki ga je mogoče izbrati, ali poskusite vzorec.
Izberite Izvleči. Preglejte vrednosti, število pojavitev in izvorne strani; filtrirajte ali razvrstite seznam.
Kopirajte vrednosti ali prenesite CSV s sklici na strani oziroma preprost seznam TXT.
Izberite vrste podatkov, ki jih potrebujete: e-poštna sporočila, telefonske številke, URL-je, številčne datume, naslove IPv4, domene, DOI, ISBN, hashtage in naslove MAC. Preglejte izluščene vrednosti s štetjem in sklici na strani.
Zberite vrednosti DOI in ISBN s stranmi, na katerih se pojavljajo.
Poiščite datirane vnose in naslove IPv4.
Združite e-poštne naslove, telefonske številke in spletne povezave v en strukturiran izvoz.
Začnite z e-pošto, telefoni in URL-ji, nato odprite Več vrst podatkov za specializirane vrednosti.
Datumi morajo uporabljati številčni format s štirimestnim letom; dvoumne vrednosti dneva/meseca ohranijo svoj izvorni vrstni red. Okteti IPv4 so potrjeni; IPv6 ni vključen.
Domene so izpeljane iz prepoznanih e-poštnih naslovov in spletnih povezav, ne iz poljubnih imen datotek. Ekstrakcija DOI zajema običajne sodobne oblike DOI, ne vseh zgodovinskih oblik. Vrednosti ISBN-13 potrebujejo veljavno kontrolno vsoto; ISBN-10 potrebuje tudi oznako ISBN. Hashtagi lahko vsebujejo znake Unicode, vključno z arabskimi.
Naslovi MAC uporabljajo šest parov, ločenih z dvopičjem ali vezajem. Orodje nikoli ne vzpostavi stika z ekstrahiranimi naslovi ali identifikatorji.
Preverite števila, skočite na stran PDF-ja in filtrirajte seznam rezultatov.
Vsak rezultat beleži fizični položaj strani v PDF-ju, ki se lahko razlikuje od natisnjenih številk strani. Izberite oznako strani, da odprete predogled s približnim poudarkom.
Odstranjevanje dvojnikov je privzeto vklopljeno. Števila združujejo prepoznane ponovitve iste vrednosti; izklopite to možnost, če želite videti ločene pojavitve. Razvrščanje po abecedi spremeni vrstni red seznama. Filtriranje velja za kopiranje in prenose ter za vidne vrstice.
Izberite CSV za števila in strani ali TXT za eno vrednost na vrstico.
CSV vsebuje stolpce Vrsta, Vrednost, Število in Strani. Kodiranje UTF-8 podpira arabščino in druge pisave. Vrednosti, ki bi jih lahko interpretirali kot formule preglednic, so za varnejši uvoz predponirane z apostrofom.
TXT in Kopiraj vse vsebujeta samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo filtru, tudi če tabela na zaslonu obsega več strani z rezultati. Nov PDF se ne ustvari in izvorni PDF ostane nespremenjen.
Obdelajte en PDF v svojem brskalniku z izrecnimi omejitvami in obvestili o delnih rezultatih.
Naložite en PDF do 50 MiB in 500 strani. Ekstrakcija preveri do 250.000 znakov in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Proračun 90 sekund za ekstrakcijo omejuje dolgotrajna opravila. Zelo zapleteni dokumenti lahko delujejo bolje, če so razdeljeni na manjše datoteke.
Ko je dosežena omejitev ali strani ni mogoče v celoti prebrati, rezultati prikažejo obvestilo, omejeni ali neuspešni zagoni pa v imenu datoteke izvozijo delne rezultate. Strani brez izbirnega besedila se štejejo ločeno. Uporabite PDF OCR za skenirane slike, nato se vrnite, da ekstrahirate prepoznano besedilo.
Vsebina PDF se obdeluje lokalno v tem brskalniku. Naloženi dokumenti se ne pošiljajo na strežnik za ekstrakcijo. Povezave, e-poštni naslovi in telefonske številke, najdeni v PDF-ju, se nikoli ne kontaktirajo samodejno.
Odprite en PDF do 50 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.
Obdelava poteka v vaši napravi brez nalaganja dokumenta. Prenesite rezultat, preden zaprete stran; izvirnik shranite ločeno.
Vedite, kaj pričakovati, preden začnete.
V vaši napraviIzberite vrste podatkov, ki jih potrebujete: e-poštna sporočila, telefonske številke, URL-je, številčne datume, naslove IPv4, domene, DOI, ISBN, hashtage in naslove MAC. Preglejte pridobljene vrednosti s števili in sklici na strani. To orodje pridobi prepoznavne vrednosti, ne tabel, računov ali semantičnih polj. Vzorci in kontrolne vsote zmanjšajo šum, vendar ne zagotavljajo popolnosti ali dokazujejo, da je identifikator pristen.
Prebere se samo izbirno besedilo in prepoznani cilji povezav. Strani, ki vsebujejo samo slike, najprej potrebujejo OCR PDF-ja. Zaženite OCR, prenesite iskalni PDF in se nato vrnite k temu ekstraktorju.
Odstranjevanje dvojnikov združi prepoznane enakovredne vrednosti. Štetje prikazuje zaznane ponovitve, strani pa navajajo fizične položaje strani v PDF-ju. Onemogočite to možnost, če želite ohraniti ločene ponovitve. Natisnjen cilj in ujemajoča se povezava na isti strani se ne štejeta dvakrat.
CSV vključuje vrsto, vrednost, število ponovitev in sklice na strani. TXT in Kopiraj vse zagotavljata samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo trenutnemu filtru, ne le vidna stran tabele.
Ne. Razčlenjevanje PDF-ja, ujemanje in izvozi potekajo v tem brskalniku. Izvirni PDF ostane nespremenjen. Nobena ekstrahirana povezava, e-poštni naslov ali telefonska številka se ne kontaktira samodejno.
En PDF do 50 MiB in 500 strani. Pridobivanje je omejeno na 250.000 znakov besedila in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Rezultati vsebujejo obvestilo, če so zaradi omejitev ali neberljivih strani delni.
HITRA VIDEO VADNICA
Kako izluščiti strukturirane podatke iz PDF-ja
Zberite stike in raziskovalne identifikatorje na enem organiziranem seznamu.
Angleška pripoved
Oglejte si video