Mga Tool150

Isang kapaki-pakinabang na gawain sa PDF, ginawang simple

Kumuha ng Data mula sa PDF.

Hanapin ang data na kailangan mo. Panatilihin ang source page sa bawat resulta.

Advertisements
Ang iyong workspace para sa PDF
Sa iyong device
o i-drop ang iyong mga file dito
Ang iyong PDF ay pinoproseso sa browser na ito. PDF
Advertisements

Paano kumuha ng data mula sa pdf

  1. 01

    Pumili ng isang PDF

    Mag-load ng dokumento na may text na maaaring piliin, o subukan ang sample.

  2. 02

    Kunin at suriin

    Piliin ang Kunin. Suriin ang mga value, bilang at source na pahina; i-filter o i-sort ang listahan.

  3. 03

    Kopyahin o i-download

    Kopyahin ang mga value, o i-download ang CSV na may mga reference ng pahina o isang simpleng listahan ng TXT.

BlogPaano kumuha ng structured data mula sa isang PDFBasahin ang gabay

Kumuha ng mga structured na halaga mula sa isang PDF patungong CSV o text

Piliin ang mga uri ng data na kailangan mo: mga email, numero ng telepono, URL, numeric na petsa, IPv4 address, domain, DOI, ISBN, hashtag, at MAC address. Suriin ang mga nakuhang halaga na may mga bilang at sanggunian sa pahina.

Ang mga kinikilalang halaga ay nagiging isang listahan na may mga sanggunian sa source page.
MABILIS NA VIDEO TUTORIAL Paano kumuha ng structured data mula sa isang PDF Mangolekta ng mga contact at research identifier sa isang organisadong listahan. Pagsasalaysay sa Ingles Panoorin ang video

Paano kumuha ng structured data mula sa isang PDF

Kailan ito kapaki-pakinabang?

Pananaliksik

Mangolekta ng mga identifier

Mangolekta ng mga halaga ng DOI at ISBN kasama ang mga pahina kung saan lumalabas ang mga ito.

Mga Ulat

Ilabas ang mga numeric na detalye

Maghanap ng mga may petsang entry at IPv4 address.

Mga direktoryo

Bumuo ng listahan ng contact

Pagsamahin ang mga email, telepono, at web link sa isang structured na export.

Mga feature at kontrol

Pumili ng mga kapaki-pakinabang na uri ng data

Magsimula sa mga email, telepono, at URL, pagkatapos ay buksan ang More data types para sa mga espesyal na value.

Ano ang sinusuportahan ng mga recognizer

Ang mga petsa ay dapat gumamit ng numeric na format na may apat na digit na taon; ang mga malabong value ng araw/buwan ay pinapanatili ang kanilang source order. Ang mga IPv4 octet ay bina-validate; ang IPv6 ay hindi kasama.

Ang mga domain ay nagmumula sa mga nakilalang email at web link, hindi sa mga arbitrary na filename. Ang extraction ng DOI ay sumasaklaw sa mga karaniwang modernong anyo ng DOI, hindi sa bawat historikal na anyo. Ang mga value ng ISBN-13 ay nangangailangan ng valid na checksum; ang ISBN-10 ay nangangailangan din ng label na ISBN. Ang mga hashtag ay maaaring maglaman ng mga titik na Unicode, kabilang ang Arabic.

Ang mga MAC address ay gumagamit ng anim na pares na pinaghihiwalay ng colon o hyphen. Ang tool ay hindi kailanman kumokontak sa mga na-extract na address o identifier.

Suriin ang mga value kasama ang kanilang mga source page

Tingnan ang mga bilang, tumalon sa isang pahina ng PDF, at i-filter ang listahan ng resulta.

Suriin at ayusin

Ang bawat resulta ay nagtatala ng pisikal na posisyon ng pahina sa PDF, na maaaring magkaiba sa mga naka-print na numero ng pahina. Pumili ng page chip upang buksan ang preview na may humigit-kumulang na highlight.

Ang pag-aalis ng mga duplicate ay naka-enable simula pa lang. Pinagsasama ng mga bilang ang mga nakilalang pag-uulit ng parehong value; i-off ito upang makita ang magkakahiwalay na paglitaw. Ang pag-aayos nang pa-alpabeto ay nagbabago sa pagkakasunod-sunod ng listahan. Ang pag-filter ay nalalapat sa pag-copy at pag-download pati na rin sa mga nakikitang row.

I-copy ang mga value o i-download ang isang structured na listahan

Pumili ng CSV para sa mga bilang at pahina, o TXT para sa isang value bawat linya.

Ano ang nilalaman ng bawat download

Ang CSV ay naglalaman ng mga column na Type, Value, Count, at Pages. Ang UTF-8 encoding ay sumusuporta sa Arabic at iba pang script. Ang mga value na maaaring bigyang-kahulugan bilang mga spreadsheet formula ay nilalagyan ng apostrophe sa unahan para sa mas ligtas na pag-import.

Ang TXT at Copy ay parehong naglalaman ng mga value lamang, isa bawat linya. Kasama ang lahat ng row na tumutugma sa filter, kahit na ang table sa screen ay sumasaklaw sa ilang pahina ng resulta. Walang bagong PDF ang nililikha at ang source PDF ay hindi nababago.

Panatilihing madaling pamahalaan ang malalaking extraction

Magproseso ng isang PDF sa iyong browser, na may mga malinaw na limitasyon at mga paunawa para sa partial-result.

Mga file, limitasyon, at mga na-scan na pahina

Mag-load ng isang PDF na hanggang 50 MiB at 500 pahina. Ang extraction ay nagsusuri ng hanggang 250,000 character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang 90-segundong budget sa extraction ay naglilimita sa mahahabang run. Ang mga napakakumplikadong dokumento ay maaaring mas gumana nang maayos kapag hinati sa mas maliliit na file.

Kapag naabot ang isang limitasyon o hindi mabasa nang buo ang isang pahina, ang mga resulta ay nagpapakita ng paunawa at ang mga limitado o nabigong run ay nag-e-export na may partial sa filename. Ang mga pahinang walang mapipiling teksto ay binibilang nang hiwalay. Gamitin ang PDF OCR para sa mga image-only na scan, pagkatapos ay bumalik upang i-extract ang nakilalang teksto.

Ang nilalaman ng PDF ay pinoproseso nang lokal sa browser na ito. Ang mga na-upload na dokumento ay hindi ipinapadala sa isang extraction server. Ang mga link, email address, at numero ng telepono na matatagpuan sa loob ng PDF ay hindi kailanman awtomatikong kinokontak.

Mga suportadong file at pagproseso

Input
PDF
Output
CSV / TXT

Magbukas ng isang PDF na hanggang 50 MB at 750 na pahina. Maaaring maglapat ng karagdagang limitasyon sa output, memorya, at pagproseso para sa mga kumplikadong dokumento.

Ang pagproseso ay nagaganap sa iyong device nang hindi nag-a-upload ng dokumento. I-download ang iyong resulta bago isara ang pahina; panatilihing hiwalay ang orihinal.

Advertisements
FAQ

Ilang kapaki-pakinabang na sagot

Alamin kung ano ang aasahan bago ka magsimula.

Sa iyong device
Ano ang kayang kilalanin ng tool na ito?

Piliin ang mga uri ng data na kailangan mo: mga email, numero ng telepono, URL, numeric na petsa, IPv4 address, domain, DOI, ISBN, hashtag, at MAC address. Suriin ang mga na-extract na halaga kasama ang mga bilang at sanggunian sa pahina. Nag-e-extract ito ng mga kinikilalang halaga, hindi mga table, invoice, o semantic field. Ang mga pattern at checksum ay nagbabawas ng ingay ngunit hindi ginagarantiyahan ang pagiging kumpleto o nagpapatunay na ang isang identifier ay tunay.

Maaari ba akong mag-extract ng data mula sa mga scanned PDF?

Ang mga selectable na text at kinikilalang link target lamang ang nababasa. Ang mga image-only na pahina ay nangangailangan muna ng PDF OCR. Patakbuhin ang OCR, i-download ang searchable PDF, at bumalik sa extractor na ito.

Paano pinangangasiwaan ang mga duplicate at bilang?

Pinagsasama ng pag-alis ng mga duplicate ang mga kinikilalang katumbas na halaga. Ipinapakita ng Count ang mga natukoy na paglitaw at inililista ng Pages ang mga pisikal na posisyon ng pahina sa PDF. I-disable ang opsyon para panatilihing magkahiwalay ang mga paglitaw. Ang isang nakalimbag na target at tumutugmang clickable link sa parehong pahina ay hindi bibilangin nang dalawang beses.

Ano ang pagkakaiba ng CSV at TXT?

Kasama sa CSV ang uri, halaga, bilang ng paglitaw, at mga sanggunian sa pahina. Ang TXT at Copy all ay nagbibigay lamang ng mga halaga, isa bawat linya. Kasama ang lahat ng row na tumutugma sa kasalukuyang filter, hindi lamang ang nakikitang pahina ng table.

Ina-upload ba ang PDF para sa extraction?

Hindi. Ang pag-parse, pag-match, at pag-export ng PDF ay tumatakbo sa browser na ito. Ang orihinal na PDF ay hindi nababago. Walang na-extract na link, email, o numero ng telepono ang awtomatikong kinokontak.

Ano ang mga limitasyon?

Isang PDF na hanggang 50 MiB at 500 pahina. Ang pag-extract ay limitado sa 250,000 text character at 2,000 match bawat pahina, 10 milyong character at 20,000 match sa kabuuan, at 2,000 annotation bawat pahina. Ang mga resulta ay may paunawa kung ang mga limitasyon o hindi nababasang pahina ay nagreresulta sa bahagyang pagkuha.

Magpatuloy

Ano ang gusto mong gawin susunod?

Pumili ng tool. Sasama sa iyo ang iyong natapos na PDF.

PDF

Advertisements

Wika38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina