Mangolekta ng mga source link
Bumuo ng listahan ng sanggunian mula sa mga ulat at dokumento ng pananaliksik.
Ilabas ang mga kapaki-pakinabang na link mula sa iyong PDF.
| Uri | Value | Bilang | Mga pahina |
|---|
Ang pag-copy at pag-download ay may kasamang lahat ng tumutugmang row sa bawat pahina ng resulta. Ang CSV ay may kasamang bilang at numero ng pahina ng PDF; ang TXT ay naglalaman lamang ng mga value.
Pumili ng numero ng pahina sa Mga Resulta para suriin ang source nito. Ipinapakita ng mga highlight ang mga tinatayang posisyon.
Handa na ang iyong listahan. I-download ito, o bumalik para suriin at baguhin ang format.
Mag-load ng dokumento na may text na maaaring piliin, o subukan ang sample.
Piliin ang Kunin. Suriin ang mga value, bilang at source na pahina; i-filter o i-sort ang listahan.
Kopyahin ang mga value, o i-download ang CSV na may mga reference ng pahina o isang simpleng listahan ng TXT.
Mangolekta ng mga naka-print na HTTP/HTTPS address, www address, at clickable na target ng web-link mula sa isang PDF. Panatilihin ang mga sanggunian sa pahina at i-download ang isang deduplicated na listahan bilang CSV o TXT.
Bumuo ng listahan ng sanggunian mula sa mga ulat at dokumento ng pananaliksik.
Kunin ang mga destinasyon sa likod ng mga clickable na label ng mapagkukunan.
I-record kung saan nahanap ang bawat link bago ito suriin sa ibang lugar.
Isama ang target ng link kahit na ang label nito ay “Read more” lamang.
Ang mga naka-print na link na nagsisimula sa http://, https:// o www. ay kinikilala. Ang mga PDF link annotation ay maaari ring magbunyag ng mga HTTP/HTTPS target sa likod ng ordinaryong teksto. Hindi kailangang ipakita ng PDF ang URL bilang maki-click na label nito.
Ang magkaparehong naka-print na target at annotation sa isang pahina ay hindi binibilang nang dalawang beses. Ginagamit ang mga normalized na anyo ng URL para sa paghahambing ng duplicate, habang ang unang nakilalang baybay ang ipinapakita. Ang mahahaba, nakabalot, o sirang mga URL ay maaaring mangailangan ng manu-manong pagwawasto. Walang na-extract na URL ang awtomatikong kinukuha.
Tingnan ang mga bilang, tumalon sa isang pahina ng PDF, at i-filter ang listahan ng resulta.
Ang bawat resulta ay nagtatala ng pisikal na posisyon ng pahina sa PDF, na maaaring magkaiba sa mga naka-print na numero ng pahina. Pumili ng page chip upang buksan ang preview na may humigit-kumulang na highlight.
Ang pag-aalis ng mga duplicate ay naka-enable simula pa lang. Pinagsasama ng mga bilang ang mga nakilalang pag-uulit ng parehong value; i-off ito upang makita ang magkakahiwalay na paglitaw. Ang pag-aayos nang pa-alpabeto ay nagbabago sa pagkakasunod-sunod ng listahan. Ang pag-filter ay nalalapat sa pag-copy at pag-download pati na rin sa mga nakikitang row.
Pumili ng CSV para sa mga bilang at pahina, o TXT para sa isang value bawat linya.
Ang CSV ay naglalaman ng mga column na Type, Value, Count, at Pages. Ang UTF-8 encoding ay sumusuporta sa Arabic at iba pang script. Ang mga value na maaaring bigyang-kahulugan bilang mga spreadsheet formula ay nilalagyan ng apostrophe sa unahan para sa mas ligtas na pag-import.
Ang TXT at Copy ay parehong naglalaman ng mga value lamang, isa bawat linya. Kasama ang lahat ng row na tumutugma sa filter, kahit na ang table sa screen ay sumasaklaw sa ilang pahina ng resulta. Walang bagong PDF ang nililikha at ang source PDF ay hindi nababago.
Magproseso ng isang PDF sa iyong browser, na may mga malinaw na limitasyon at mga paunawa para sa partial-result.
Mag-load ng isang PDF na hanggang 50 MiB at 500 pahina. Ang extraction ay nagsusuri ng hanggang 250,000 character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang 90-segundong budget sa extraction ay naglilimita sa mahahabang run. Ang mga napakakumplikadong dokumento ay maaaring mas gumana nang maayos kapag hinati sa mas maliliit na file.
Kapag naabot ang isang limitasyon o hindi mabasa nang buo ang isang pahina, ang mga resulta ay nagpapakita ng paunawa at ang mga limitado o nabigong run ay nag-e-export na may partial sa filename. Ang mga pahinang walang mapipiling teksto ay binibilang nang hiwalay. Gamitin ang PDF OCR para sa mga image-only na scan, pagkatapos ay bumalik upang i-extract ang nakilalang teksto.
Ang nilalaman ng PDF ay pinoproseso nang lokal sa browser na ito. Ang mga na-upload na dokumento ay hindi ipinapadala sa isang extraction server. Ang mga link, email address, at numero ng telepono na matatagpuan sa loob ng PDF ay hindi kailanman awtomatikong kinokontak.
Magbukas ng isang PDF na hanggang 50 MB at 750 na pahina. Maaaring maglapat ng karagdagang limitasyon sa output, memorya, at pagproseso para sa mga kumplikadong dokumento.
Ang pagproseso ay nagaganap sa iyong device nang hindi nag-a-upload ng dokumento. I-download ang iyong resulta bago isara ang pahina; panatilihing hiwalay ang orihinal.
Alamin kung ano ang aasahan bago ka magsimula.
Sa iyong deviceMangolekta ng mga nakalimbag na HTTP/HTTPS address, www address, at mga clickable na web-link target mula sa isang PDF. Panatilihin ang mga sanggunian sa pahina at i-download ang deduplicated na listahan bilang CSV o TXT. Hindi sinusuri ng tool kung gumagana pa ang mga link. Ang mga internal na destinasyon sa pahina, JavaScript action, mailto, at iba pang non-web scheme ay hindi ie-export bilang mga web link.
Ang mga selectable na text at kinikilalang link target lamang ang nababasa. Ang mga image-only na pahina ay nangangailangan muna ng PDF OCR. Patakbuhin ang OCR, i-download ang searchable PDF, at bumalik sa extractor na ito.
Pinagsasama ng pag-alis ng mga duplicate ang mga kinikilalang katumbas na halaga. Ipinapakita ng Count ang mga natukoy na paglitaw at inililista ng Pages ang mga pisikal na posisyon ng pahina sa PDF. I-disable ang opsyon para panatilihing magkahiwalay ang mga paglitaw. Ang isang nakalimbag na target at tumutugmang clickable link sa parehong pahina ay hindi bibilangin nang dalawang beses.
Kasama sa CSV ang uri, halaga, bilang ng paglitaw, at mga sanggunian sa pahina. Ang TXT at Copy all ay nagbibigay lamang ng mga halaga, isa bawat linya. Kasama ang lahat ng row na tumutugma sa kasalukuyang filter, hindi lamang ang nakikitang pahina ng table.
Hindi. Ang pag-parse, pag-match, at pag-export ng PDF ay tumatakbo sa browser na ito. Ang orihinal na PDF ay hindi nababago. Walang na-extract na link, email, o numero ng telepono ang awtomatikong kinokontak.
Isang PDF na hanggang 50 MiB at 500 pahina. Ang pag-extract ay limitado sa 250,000 text character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang mga resulta ay may paunawa kung ang mga limitasyon o hindi nababasang pahina ay nagreresulta sa bahagyang pagkuha.
MABILIS NA VIDEO TUTORIAL
Paano kumuha ng mga link at URL mula sa isang PDF
Panatilihin ang mga kapaki-pakinabang na web link nang hindi binubuksan ang mga ito nang paisa-isa.
Pagsasalaysay sa Ingles
Panoorin ang video