Orodja150

Uporabno opravilo s PDF-om, narejeno preprosto

Izlušči podatke iz PDF-ja.

Poiščite podatke, ki jih potrebujete. Ohranite izvorno stran za vsak rezultat.

Advertisements
Vaš delovni prostor za PDF
V vaši napravi
ali spustite datoteke sem
Vaš PDF se obdeluje v tem brskalniku. PDF
Advertisements

Kako izluščiti podatke iz PDF-ja

  1. 01

    Izberite en PDF

    Naložite dokument z besedilom, ki ga je mogoče izbrati, ali poskusite vzorec.

  2. 02

    Izvlecite in preglejte

    Izberite Izvleči. Preglejte vrednosti, število pojavitev in izvorne strani; filtrirajte ali razvrstite seznam.

  3. 03

    Kopirajte ali prenesite

    Kopirajte vrednosti ali prenesite CSV s sklici na strani oziroma preprost seznam TXT.

BlogKako izluščiti strukturirane podatke iz PDF-jaPreberi vodič

Izluščite strukturirane vrednosti iz PDF-ja v CSV ali besedilo

Izberite vrste podatkov, ki jih potrebujete: e-poštna sporočila, telefonske številke, URL-je, številčne datume, naslove IPv4, domene, DOI, ISBN, hashtage in naslove MAC. Preglejte izluščene vrednosti s štetjem in sklici na strani.

Prepoznane vrednosti postanejo seznam s sklici na izvorne strani.
HITRA VIDEO VADNICA Kako izluščiti strukturirane podatke iz PDF-ja Zberite stike in raziskovalne identifikatorje na enem organiziranem seznamu. Angleška pripoved Oglejte si video

Kako izluščiti strukturirane podatke iz PDF-ja

Kdaj je to uporabno?

Raziskovanje

Zbiranje identifikatorjev

Zberite vrednosti DOI in ISBN s stranmi, na katerih se pojavljajo.

Poročila

Izvlecite številčne podrobnosti

Poiščite datirane vnose in naslove IPv4.

Imeniki

Izgradite seznam stikov

Združite e-poštne naslove, telefonske številke in spletne povezave v en strukturiran izvoz.

Funkcije in kontrole

Izberite uporabne vrste podatkov

Začnite z e-pošto, telefoni in URL-ji, nato odprite Več vrst podatkov za specializirane vrednosti.

Kaj podpirajo prepoznavalniki

Datumi morajo uporabljati številčni format s štirimestnim letom; dvoumne vrednosti dneva/meseca ohranijo svoj izvorni vrstni red. Okteti IPv4 so potrjeni; IPv6 ni vključen.

Domene so izpeljane iz prepoznanih e-poštnih naslovov in spletnih povezav, ne iz poljubnih imen datotek. Ekstrakcija DOI zajema običajne sodobne oblike DOI, ne vseh zgodovinskih oblik. Vrednosti ISBN-13 potrebujejo veljavno kontrolno vsoto; ISBN-10 potrebuje tudi oznako ISBN. Hashtagi lahko vsebujejo znake Unicode, vključno z arabskimi.

Naslovi MAC uporabljajo šest parov, ločenih z dvopičjem ali vezajem. Orodje nikoli ne vzpostavi stika z ekstrahiranimi naslovi ali identifikatorji.

Preglejte vrednosti z njihovimi izvornimi stranmi

Preverite števila, skočite na stran PDF-ja in filtrirajte seznam rezultatov.

Preglejte in organizirajte

Vsak rezultat beleži fizični položaj strani v PDF-ju, ki se lahko razlikuje od natisnjenih številk strani. Izberite oznako strani, da odprete predogled s približnim poudarkom.

Odstranjevanje dvojnikov je privzeto vklopljeno. Števila združujejo prepoznane ponovitve iste vrednosti; izklopite to možnost, če želite videti ločene pojavitve. Razvrščanje po abecedi spremeni vrstni red seznama. Filtriranje velja za kopiranje in prenose ter za vidne vrstice.

Kopirajte vrednosti ali prenesite strukturiran seznam

Izberite CSV za števila in strani ali TXT za eno vrednost na vrstico.

Kaj vsebuje vsak prenos

CSV vsebuje stolpce Vrsta, Vrednost, Število in Strani. Kodiranje UTF-8 podpira arabščino in druge pisave. Vrednosti, ki bi jih lahko interpretirali kot formule preglednic, so za varnejši uvoz predponirane z apostrofom.

TXT in Kopiraj vse vsebujeta samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo filtru, tudi če tabela na zaslonu obsega več strani z rezultati. Nov PDF se ne ustvari in izvorni PDF ostane nespremenjen.

Naj bodo velike ekstrakcije obvladljive

Obdelajte en PDF v svojem brskalniku z izrecnimi omejitvami in obvestili o delnih rezultatih.

Datoteke, omejitve in skenirane strani

Naložite en PDF do 50 MiB in 500 strani. Ekstrakcija preveri do 250.000 znakov in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Proračun 90 sekund za ekstrakcijo omejuje dolgotrajna opravila. Zelo zapleteni dokumenti lahko delujejo bolje, če so razdeljeni na manjše datoteke.

Ko je dosežena omejitev ali strani ni mogoče v celoti prebrati, rezultati prikažejo obvestilo, omejeni ali neuspešni zagoni pa v imenu datoteke izvozijo delne rezultate. Strani brez izbirnega besedila se štejejo ločeno. Uporabite PDF OCR za skenirane slike, nato se vrnite, da ekstrahirate prepoznano besedilo.

Vsebina PDF se obdeluje lokalno v tem brskalniku. Naloženi dokumenti se ne pošiljajo na strežnik za ekstrakcijo. Povezave, e-poštni naslovi in telefonske številke, najdeni v PDF-ju, se nikoli ne kontaktirajo samodejno.

Podprte datoteke in obdelava

Vhod
PDF
Izhod
CSV / TXT

Odprite en PDF do 50 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.

Obdelava poteka v vaši napravi brez nalaganja dokumenta. Prenesite rezultat, preden zaprete stran; izvirnik shranite ločeno.

Advertisements
Pogosta vprašanja

Nekaj koristnih odgovorov

Vedite, kaj pričakovati, preden začnete.

V vaši napravi
Kaj lahko to orodje prepozna?

Izberite vrste podatkov, ki jih potrebujete: e-poštna sporočila, telefonske številke, URL-je, številčne datume, naslove IPv4, domene, DOI, ISBN, hashtage in naslove MAC. Preglejte pridobljene vrednosti s števili in sklici na strani. To orodje pridobi prepoznavne vrednosti, ne tabel, računov ali semantičnih polj. Vzorci in kontrolne vsote zmanjšajo šum, vendar ne zagotavljajo popolnosti ali dokazujejo, da je identifikator pristen.

Ali lahko pridobim podatke iz skeniranih PDF-jev?

Prebere se samo izbirno besedilo in prepoznani cilji povezav. Strani, ki vsebujejo samo slike, najprej potrebujejo OCR PDF-ja. Zaženite OCR, prenesite iskalni PDF in se nato vrnite k temu ekstraktorju.

Kako se obravnavajo dvojniki in števila?

Odstranjevanje dvojnikov združi prepoznane enakovredne vrednosti. Štetje prikazuje zaznane ponovitve, strani pa navajajo fizične položaje strani v PDF-ju. Onemogočite to možnost, če želite ohraniti ločene ponovitve. Natisnjen cilj in ujemajoča se povezava na isti strani se ne štejeta dvakrat.

Kakšna je razlika med CSV in TXT?

CSV vključuje vrsto, vrednost, število ponovitev in sklice na strani. TXT in Kopiraj vse zagotavljata samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo trenutnemu filtru, ne le vidna stran tabele.

Ali se PDF naloži za ekstrakcijo?

Ne. Razčlenjevanje PDF-ja, ujemanje in izvozi potekajo v tem brskalniku. Izvirni PDF ostane nespremenjen. Nobena ekstrahirana povezava, e-poštni naslov ali telefonska številka se ne kontaktira samodejno.

Kakšne so omejitve?

En PDF do 50 MiB in 500 strani. Pridobivanje je omejeno na 250.000 znakov besedila in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Rezultati vsebujejo obvestilo, če so zaradi omejitev ali neberljivih strani delni.

Nadaljuj

Kaj želite storiti naslednje?

Izberite orodje. Vaš končani PDF gre z vami.

PDF

Advertisements

Jezik38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina