Orodja150

Uporabno opravilo s PDF-om, narejeno preprosto

Izlušči povezave iz PDF-ja.

Pridobite uporabne povezave iz svojega PDF-ja.

Advertisements
Vaš delovni prostor za PDF
V vaši napravi
ali spustite datoteke sem
Vaš PDF se obdeluje v tem brskalniku. PDF
Advertisements

Kako izluščiti povezave iz PDF-ja

  1. 01

    Izberite en PDF

    Naložite dokument z besedilom, ki ga je mogoče izbrati, ali poskusite vzorec.

  2. 02

    Izvlecite in preglejte

    Izberite Izvleči. Preglejte vrednosti, število pojavitev in izvorne strani; filtrirajte ali razvrstite seznam.

  3. 03

    Kopirajte ali prenesite

    Kopirajte vrednosti ali prenesite CSV s sklici na strani oziroma preprost seznam TXT.

BlogKako izluščiti povezave in URL-je iz PDF-jaPreberi vodič

Izluščite PDF povezave brez odpiranja vsake strani

Zberite natisnjene naslove HTTP/HTTPS, naslove www in klikljive cilje spletnih povezav iz enega PDF-ja. Ohranite sklice na strani in prenesite dedupliciran seznam kot CSV ali TXT.

Prepoznane vrednosti postanejo seznam s sklici na izvorne strani.
HITRA VIDEO VADNICA Kako izluščiti povezave in URL-je iz PDF-ja Ohranite uporabne spletne povezave, ne da bi jih odpirali eno po eno. Angleška pripoved Oglejte si video

Kako izluščiti povezave in URL-je iz PDF-ja

Kdaj je to uporabno?

Reference

Zbiranje izvornih povezav

Ustvarite seznam referenc iz poročil in raziskovalnih dokumentov.

Viri

Shranite uporabne cilje

Izluščite cilje za klikljivimi oznakami virov.

Pregled

Vodenje revizijskega seznama

Zabeležite, kje je bila vsaka povezava najdena, preden jo pregledate drugje.

Funkcije in kontrole

Poiščite vidne in klikljive povezave

Vključite cilj povezave, tudi če je na oznaki zapisano le „Preberi več“.

Kako deluje ekstrakcija povezav

Natisnjene povezave, ki se začnejo z http://, https:// ali www., so prepoznane. Povezave v PDF-ju lahko razkrijejo tudi cilje HTTP/HTTPS za običajnim besedilom. PDF-ju ni treba prikazati URL-ja kot klikljive oznake.

Enaki natisnjeni cilji in opombe na strani se ne štejejo dvakrat. Za primerjavo dvojnikov se uporabljajo normalizirane oblike URL-jev, medtem ko je prikazan prvi prepoznani zapis. Dolgi, prelomljeni ali poškodovani URL-ji lahko zahtevajo ročni popravek. Noben ekstrahiran URL se ne pridobi samodejno.

Preglejte vrednosti z njihovimi izvornimi stranmi

Preverite števila, skočite na stran PDF-ja in filtrirajte seznam rezultatov.

Preglejte in organizirajte

Vsak rezultat beleži fizični položaj strani v PDF-ju, ki se lahko razlikuje od natisnjenih številk strani. Izberite oznako strani, da odprete predogled s približnim poudarkom.

Odstranjevanje dvojnikov je privzeto vklopljeno. Števila združujejo prepoznane ponovitve iste vrednosti; izklopite to možnost, če želite videti ločene pojavitve. Razvrščanje po abecedi spremeni vrstni red seznama. Filtriranje velja za kopiranje in prenose ter za vidne vrstice.

Kopirajte vrednosti ali prenesite strukturiran seznam

Izberite CSV za števila in strani ali TXT za eno vrednost na vrstico.

Kaj vsebuje vsak prenos

CSV vsebuje stolpce Vrsta, Vrednost, Število in Strani. Kodiranje UTF-8 podpira arabščino in druge pisave. Vrednosti, ki bi jih lahko interpretirali kot formule preglednic, so za varnejši uvoz predponirane z apostrofom.

TXT in Kopiraj vse vsebujeta samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo filtru, tudi če tabela na zaslonu obsega več strani z rezultati. Nov PDF se ne ustvari in izvorni PDF ostane nespremenjen.

Naj bodo velike ekstrakcije obvladljive

Obdelajte en PDF v svojem brskalniku z izrecnimi omejitvami in obvestili o delnih rezultatih.

Datoteke, omejitve in skenirane strani

Naložite en PDF do 50 MiB in 500 strani. Ekstrakcija preveri do 250.000 znakov in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Proračun 90 sekund za ekstrakcijo omejuje dolgotrajna opravila. Zelo zapleteni dokumenti lahko delujejo bolje, če so razdeljeni na manjše datoteke.

Ko je dosežena omejitev ali strani ni mogoče v celoti prebrati, rezultati prikažejo obvestilo, omejeni ali neuspešni zagoni pa v imenu datoteke izvozijo delne rezultate. Strani brez izbirnega besedila se štejejo ločeno. Uporabite PDF OCR za skenirane slike, nato se vrnite, da ekstrahirate prepoznano besedilo.

Vsebina PDF se obdeluje lokalno v tem brskalniku. Naloženi dokumenti se ne pošiljajo na strežnik za ekstrakcijo. Povezave, e-poštni naslovi in telefonske številke, najdeni v PDF-ju, se nikoli ne kontaktirajo samodejno.

Podprte datoteke in obdelava

Vhod
PDF
Izhod
CSV / TXT

Odprite en PDF do 50 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.

Obdelava poteka v vaši napravi brez nalaganja dokumenta. Prenesite rezultat, preden zaprete stran; izvirnik shranite ločeno.

Advertisements
Pogosta vprašanja

Nekaj koristnih odgovorov

Vedite, kaj pričakovati, preden začnete.

V vaši napravi
Kaj lahko to orodje prepozna?

Zberite natisnjene naslove HTTP/HTTPS, naslove www in cilje povezav, na katere je mogoče klikniti, iz enega PDF-ja. Obdržite sklice na strani in prenesite seznam brez dvojnikov kot CSV ali TXT. Orodje ne preverja, ali povezave še delujejo. Notranji cilji strani, dejanja JavaScript, mailto in druge nespletne sheme se ne izvozijo kot spletne povezave.

Ali lahko pridobim podatke iz skeniranih PDF-jev?

Prebere se samo izbirno besedilo in prepoznani cilji povezav. Strani, ki vsebujejo samo slike, najprej potrebujejo OCR PDF-ja. Zaženite OCR, prenesite iskalni PDF in se nato vrnite k temu ekstraktorju.

Kako se obravnavajo dvojniki in števila?

Odstranjevanje dvojnikov združi prepoznane enakovredne vrednosti. Štetje prikazuje zaznane ponovitve, strani pa navajajo fizične položaje strani v PDF-ju. Onemogočite to možnost, če želite ohraniti ločene ponovitve. Natisnjen cilj in ujemajoča se povezava na isti strani se ne štejeta dvakrat.

Kakšna je razlika med CSV in TXT?

CSV vključuje vrsto, vrednost, število ponovitev in sklice na strani. TXT in Kopiraj vse zagotavljata samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo trenutnemu filtru, ne le vidna stran tabele.

Ali se PDF naloži za ekstrakcijo?

Ne. Razčlenjevanje PDF-ja, ujemanje in izvozi potekajo v tem brskalniku. Izvirni PDF ostane nespremenjen. Nobena ekstrahirana povezava, e-poštni naslov ali telefonska številka se ne kontaktira samodejno.

Kakšne so omejitve?

En PDF do 50 MiB in 500 strani. Pridobivanje je omejeno na 250.000 znakov besedila in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Rezultati vsebujejo obvestilo, če so zaradi omejitev ali neberljivih strani delni.

Nadaljuj

Kaj želite storiti naslednje?

Izberite orodje. Vaš končani PDF gre z vami.

PDF

Advertisements

Jezik38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina