Zbiranje izvornih povezav
Ustvarite seznam referenc iz poročil in raziskovalnih dokumentov.
Pridobite uporabne povezave iz svojega PDF-ja.
| Vrsta | Vrednost | Število | Strani |
|---|
Kopiranje in prenos vključujeta vse ujemajoče se vrstice na vseh straneh z rezultati. CSV vključuje število pojavitev in številke strani PDF; TXT vsebuje samo vrednosti.
V rezultatih izberite številko strani za preverjanje vira. Označbe prikazujejo približne položaje.
Vaš seznam je pripravljen. Prenesite ga ali se vrnite za pregled in spremembo formata.
Naložite dokument z besedilom, ki ga je mogoče izbrati, ali poskusite vzorec.
Izberite Izvleči. Preglejte vrednosti, število pojavitev in izvorne strani; filtrirajte ali razvrstite seznam.
Kopirajte vrednosti ali prenesite CSV s sklici na strani oziroma preprost seznam TXT.
Zberite natisnjene naslove HTTP/HTTPS, naslove www in klikljive cilje spletnih povezav iz enega PDF-ja. Ohranite sklice na strani in prenesite dedupliciran seznam kot CSV ali TXT.
Ustvarite seznam referenc iz poročil in raziskovalnih dokumentov.
Izluščite cilje za klikljivimi oznakami virov.
Zabeležite, kje je bila vsaka povezava najdena, preden jo pregledate drugje.
Vključite cilj povezave, tudi če je na oznaki zapisano le „Preberi več“.
Natisnjene povezave, ki se začnejo z http://, https:// ali www., so prepoznane. Povezave v PDF-ju lahko razkrijejo tudi cilje HTTP/HTTPS za običajnim besedilom. PDF-ju ni treba prikazati URL-ja kot klikljive oznake.
Enaki natisnjeni cilji in opombe na strani se ne štejejo dvakrat. Za primerjavo dvojnikov se uporabljajo normalizirane oblike URL-jev, medtem ko je prikazan prvi prepoznani zapis. Dolgi, prelomljeni ali poškodovani URL-ji lahko zahtevajo ročni popravek. Noben ekstrahiran URL se ne pridobi samodejno.
Preverite števila, skočite na stran PDF-ja in filtrirajte seznam rezultatov.
Vsak rezultat beleži fizični položaj strani v PDF-ju, ki se lahko razlikuje od natisnjenih številk strani. Izberite oznako strani, da odprete predogled s približnim poudarkom.
Odstranjevanje dvojnikov je privzeto vklopljeno. Števila združujejo prepoznane ponovitve iste vrednosti; izklopite to možnost, če želite videti ločene pojavitve. Razvrščanje po abecedi spremeni vrstni red seznama. Filtriranje velja za kopiranje in prenose ter za vidne vrstice.
Izberite CSV za števila in strani ali TXT za eno vrednost na vrstico.
CSV vsebuje stolpce Vrsta, Vrednost, Število in Strani. Kodiranje UTF-8 podpira arabščino in druge pisave. Vrednosti, ki bi jih lahko interpretirali kot formule preglednic, so za varnejši uvoz predponirane z apostrofom.
TXT in Kopiraj vse vsebujeta samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo filtru, tudi če tabela na zaslonu obsega več strani z rezultati. Nov PDF se ne ustvari in izvorni PDF ostane nespremenjen.
Obdelajte en PDF v svojem brskalniku z izrecnimi omejitvami in obvestili o delnih rezultatih.
Naložite en PDF do 50 MiB in 500 strani. Ekstrakcija preveri do 250.000 znakov in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Proračun 90 sekund za ekstrakcijo omejuje dolgotrajna opravila. Zelo zapleteni dokumenti lahko delujejo bolje, če so razdeljeni na manjše datoteke.
Ko je dosežena omejitev ali strani ni mogoče v celoti prebrati, rezultati prikažejo obvestilo, omejeni ali neuspešni zagoni pa v imenu datoteke izvozijo delne rezultate. Strani brez izbirnega besedila se štejejo ločeno. Uporabite PDF OCR za skenirane slike, nato se vrnite, da ekstrahirate prepoznano besedilo.
Vsebina PDF se obdeluje lokalno v tem brskalniku. Naloženi dokumenti se ne pošiljajo na strežnik za ekstrakcijo. Povezave, e-poštni naslovi in telefonske številke, najdeni v PDF-ju, se nikoli ne kontaktirajo samodejno.
Odprite en PDF do 50 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.
Obdelava poteka v vaši napravi brez nalaganja dokumenta. Prenesite rezultat, preden zaprete stran; izvirnik shranite ločeno.
Vedite, kaj pričakovati, preden začnete.
V vaši napraviZberite natisnjene naslove HTTP/HTTPS, naslove www in cilje povezav, na katere je mogoče klikniti, iz enega PDF-ja. Obdržite sklice na strani in prenesite seznam brez dvojnikov kot CSV ali TXT. Orodje ne preverja, ali povezave še delujejo. Notranji cilji strani, dejanja JavaScript, mailto in druge nespletne sheme se ne izvozijo kot spletne povezave.
Prebere se samo izbirno besedilo in prepoznani cilji povezav. Strani, ki vsebujejo samo slike, najprej potrebujejo OCR PDF-ja. Zaženite OCR, prenesite iskalni PDF in se nato vrnite k temu ekstraktorju.
Odstranjevanje dvojnikov združi prepoznane enakovredne vrednosti. Štetje prikazuje zaznane ponovitve, strani pa navajajo fizične položaje strani v PDF-ju. Onemogočite to možnost, če želite ohraniti ločene ponovitve. Natisnjen cilj in ujemajoča se povezava na isti strani se ne štejeta dvakrat.
CSV vključuje vrsto, vrednost, število ponovitev in sklice na strani. TXT in Kopiraj vse zagotavljata samo vrednosti, eno na vrstico. Vključene so vse vrstice, ki ustrezajo trenutnemu filtru, ne le vidna stran tabele.
Ne. Razčlenjevanje PDF-ja, ujemanje in izvozi potekajo v tem brskalniku. Izvirni PDF ostane nespremenjen. Nobena ekstrahirana povezava, e-poštni naslov ali telefonska številka se ne kontaktira samodejno.
En PDF do 50 MiB in 500 strani. Pridobivanje je omejeno na 250.000 znakov besedila in 2.000 zadetkov na stran, 10 milijonov znakov in 20.000 zadetkov skupaj ter 2.000 opomb na stran. Rezultati vsebujejo obvestilo, če so zaradi omejitev ali neberljivih strani delni.
HITRA VIDEO VADNICA
Kako izluščiti povezave in URL-je iz PDF-ja
Ohranite uporabne spletne povezave, ne da bi jih odpirali eno po eno.
Angleška pripoved
Oglejte si video