Mangolekta ng mga identifier
Mangolekta ng mga halaga ng DOI at ISBN kasama ang mga pahina kung saan lumalabas ang mga ito.
Hanapin ang data na kailangan mo. Panatilihin ang source page sa bawat resulta.
| Uri | Value | Bilang | Mga pahina |
|---|
Ang pag-copy at pag-download ay may kasamang lahat ng tumutugmang row sa bawat pahina ng resulta. Ang CSV ay may kasamang bilang at numero ng pahina ng PDF; ang TXT ay naglalaman lamang ng mga value.
Pumili ng numero ng pahina sa Mga Resulta para suriin ang source nito. Ipinapakita ng mga highlight ang mga tinatayang posisyon.
Handa na ang iyong listahan. I-download ito, o bumalik para suriin at baguhin ang format.
Mag-load ng dokumento na may text na maaaring piliin, o subukan ang sample.
Piliin ang Kunin. Suriin ang mga value, bilang at source na pahina; i-filter o i-sort ang listahan.
Kopyahin ang mga value, o i-download ang CSV na may mga reference ng pahina o isang simpleng listahan ng TXT.
Piliin ang mga uri ng data na kailangan mo: mga email, numero ng telepono, URL, numeric na petsa, IPv4 address, domain, DOI, ISBN, hashtag, at MAC address. Suriin ang mga nakuhang halaga na may mga bilang at sanggunian sa pahina.
Mangolekta ng mga halaga ng DOI at ISBN kasama ang mga pahina kung saan lumalabas ang mga ito.
Maghanap ng mga may petsang entry at IPv4 address.
Pagsamahin ang mga email, telepono, at web link sa isang structured na export.
Magsimula sa mga email, telepono, at URL, pagkatapos ay buksan ang More data types para sa mga espesyal na value.
Ang mga petsa ay dapat gumamit ng numeric na format na may apat na digit na taon; ang mga malabong value ng araw/buwan ay pinapanatili ang kanilang source order. Ang mga IPv4 octet ay bina-validate; ang IPv6 ay hindi kasama.
Ang mga domain ay nagmumula sa mga nakilalang email at web link, hindi sa mga arbitrary na filename. Ang extraction ng DOI ay sumasaklaw sa mga karaniwang modernong anyo ng DOI, hindi sa bawat historikal na anyo. Ang mga value ng ISBN-13 ay nangangailangan ng valid na checksum; ang ISBN-10 ay nangangailangan din ng label na ISBN. Ang mga hashtag ay maaaring maglaman ng mga titik na Unicode, kabilang ang Arabic.
Ang mga MAC address ay gumagamit ng anim na pares na pinaghihiwalay ng colon o hyphen. Ang tool ay hindi kailanman kumokontak sa mga na-extract na address o identifier.
Tingnan ang mga bilang, tumalon sa isang pahina ng PDF, at i-filter ang listahan ng resulta.
Ang bawat resulta ay nagtatala ng pisikal na posisyon ng pahina sa PDF, na maaaring magkaiba sa mga naka-print na numero ng pahina. Pumili ng page chip upang buksan ang preview na may humigit-kumulang na highlight.
Ang pag-aalis ng mga duplicate ay naka-enable simula pa lang. Pinagsasama ng mga bilang ang mga nakilalang pag-uulit ng parehong value; i-off ito upang makita ang magkakahiwalay na paglitaw. Ang pag-aayos nang pa-alpabeto ay nagbabago sa pagkakasunod-sunod ng listahan. Ang pag-filter ay nalalapat sa pag-copy at pag-download pati na rin sa mga nakikitang row.
Pumili ng CSV para sa mga bilang at pahina, o TXT para sa isang value bawat linya.
Ang CSV ay naglalaman ng mga column na Type, Value, Count, at Pages. Ang UTF-8 encoding ay sumusuporta sa Arabic at iba pang script. Ang mga value na maaaring bigyang-kahulugan bilang mga spreadsheet formula ay nilalagyan ng apostrophe sa unahan para sa mas ligtas na pag-import.
Ang TXT at Copy ay parehong naglalaman ng mga value lamang, isa bawat linya. Kasama ang lahat ng row na tumutugma sa filter, kahit na ang table sa screen ay sumasaklaw sa ilang pahina ng resulta. Walang bagong PDF ang nililikha at ang source PDF ay hindi nababago.
Magproseso ng isang PDF sa iyong browser, na may mga malinaw na limitasyon at mga paunawa para sa partial-result.
Mag-load ng isang PDF na hanggang 50 MiB at 500 pahina. Ang extraction ay nagsusuri ng hanggang 250,000 character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang 90-segundong budget sa extraction ay naglilimita sa mahahabang run. Ang mga napakakumplikadong dokumento ay maaaring mas gumana nang maayos kapag hinati sa mas maliliit na file.
Kapag naabot ang isang limitasyon o hindi mabasa nang buo ang isang pahina, ang mga resulta ay nagpapakita ng paunawa at ang mga limitado o nabigong run ay nag-e-export na may partial sa filename. Ang mga pahinang walang mapipiling teksto ay binibilang nang hiwalay. Gamitin ang PDF OCR para sa mga image-only na scan, pagkatapos ay bumalik upang i-extract ang nakilalang teksto.
Ang nilalaman ng PDF ay pinoproseso nang lokal sa browser na ito. Ang mga na-upload na dokumento ay hindi ipinapadala sa isang extraction server. Ang mga link, email address, at numero ng telepono na matatagpuan sa loob ng PDF ay hindi kailanman awtomatikong kinokontak.
Magbukas ng isang PDF na hanggang 50 MB at 750 na pahina. Maaaring maglapat ng karagdagang limitasyon sa output, memorya, at pagproseso para sa mga kumplikadong dokumento.
Ang pagproseso ay nagaganap sa iyong device nang hindi nag-a-upload ng dokumento. I-download ang iyong resulta bago isara ang pahina; panatilihing hiwalay ang orihinal.
Alamin kung ano ang aasahan bago ka magsimula.
Sa iyong devicePiliin ang mga uri ng data na kailangan mo: mga email, numero ng telepono, URL, numeric na petsa, IPv4 address, domain, DOI, ISBN, hashtag, at MAC address. Suriin ang mga na-extract na halaga kasama ang mga bilang at sanggunian sa pahina. Nag-e-extract ito ng mga kinikilalang halaga, hindi mga table, invoice, o semantic field. Ang mga pattern at checksum ay nagbabawas ng ingay ngunit hindi ginagarantiyahan ang pagiging kumpleto o nagpapatunay na ang isang identifier ay tunay.
Ang mga selectable na text at kinikilalang link target lamang ang nababasa. Ang mga image-only na pahina ay nangangailangan muna ng PDF OCR. Patakbuhin ang OCR, i-download ang searchable PDF, at bumalik sa extractor na ito.
Pinagsasama ng pag-alis ng mga duplicate ang mga kinikilalang katumbas na halaga. Ipinapakita ng Count ang mga natukoy na paglitaw at inililista ng Pages ang mga pisikal na posisyon ng pahina sa PDF. I-disable ang opsyon para panatilihing magkahiwalay ang mga paglitaw. Ang isang nakalimbag na target at tumutugmang clickable link sa parehong pahina ay hindi bibilangin nang dalawang beses.
Kasama sa CSV ang uri, halaga, bilang ng paglitaw, at mga sanggunian sa pahina. Ang TXT at Copy all ay nagbibigay lamang ng mga halaga, isa bawat linya. Kasama ang lahat ng row na tumutugma sa kasalukuyang filter, hindi lamang ang nakikitang pahina ng table.
Hindi. Ang pag-parse, pag-match, at pag-export ng PDF ay tumatakbo sa browser na ito. Ang orihinal na PDF ay hindi nababago. Walang na-extract na link, email, o numero ng telepono ang awtomatikong kinokontak.
Isang PDF na hanggang 50 MiB at 500 pahina. Ang pag-extract ay limitado sa 250,000 text character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang mga resulta ay may paunawa kung ang mga limitasyon o hindi nababasang pahina ay nagreresulta sa bahagyang pagkuha.
MABILIS NA VIDEO TUTORIAL
Paano kumuha ng structured data mula sa isang PDF
Mangolekta ng mga contact at research identifier sa isang organisadong listahan.
Pagsasalaysay sa Ingles
Panoorin ang video