Alatan150

Tugas PDF yang berguna, dipermudahkan

Ekstrak Data daripada PDF.

Cari data yang anda perlukan. Simpan halaman sumber dengan setiap hasil.

Advertisements
Ruang kerja PDF anda
Pada peranti anda
atau lepaskan fail anda di sini
PDF anda diproses dalam pelayar ini. PDF
Advertisements

Cara mengekstrak data daripada pdf

  1. 01

    Pilih satu PDF

    Muatkan dokumen dengan teks yang boleh dipilih, atau cuba sampel.

  2. 02

    Ekstrak dan semak

    Pilih Ekstrak. Semak nilai, kiraan dan halaman sumber; tapis atau isih senarai.

  3. 03

    Salin atau muat turun

    Salin nilai, atau muat turun CSV dengan rujukan halaman atau senarai TXT ringkas.

BlogCara mengekstrak data berstruktur daripada PDFBaca panduan

Ekstrak nilai berstruktur daripada PDF ke dalam CSV atau teks

Pilih jenis data yang anda perlukan: e-mel, nombor telefon, URL, tarikh angka, alamat IPv4, domain, DOI, ISBN, hashtag dan alamat MAC. Semak nilai yang diekstrak dengan kiraan dan rujukan halaman.

Nilai yang diiktiraf menjadi senarai dengan rujukan halaman sumber.
TUTORIAL VIDEO PANTAS Cara mengekstrak data berstruktur daripada PDF Kumpul kenalan dan pengecam penyelidikan dalam satu senarai yang teratur. Narasi bahasa Inggeris Tonton video

Cara mengekstrak data berstruktur daripada PDF

Bilakah ini berguna?

Penyelidikan

Kumpul pengecam

Kumpul nilai DOI dan ISBN dengan halaman tempat ia muncul.

Laporan

Keluarkan butiran angka

Cari entri bertarikh dan alamat IPv4.

Direktori

Bina senarai kenalan

Gabungkan e-mel, telefon dan pautan web dalam satu eksport berstruktur.

Ciri dan kawalan

Pilih jenis data yang berguna

Mulakan dengan e-mel, telefon dan URL, kemudian buka Lebih banyak jenis data untuk nilai khusus.

Apa yang disokong oleh pengecam

Tarikh mesti menggunakan format angka dengan tahun empat digit; nilai hari/bulan yang samar mengekalkan susunan sumbernya. Oktet IPv4 disahkan; IPv6 tidak disertakan.

Domain diperoleh daripada e-mel dan pautan web yang diiktiraf, bukan nama fail sebarangan. Pengekstrakan DOI meliputi bentuk DOI moden yang biasa, bukan setiap bentuk sejarah. Nilai ISBN-13 memerlukan checksum yang sah; ISBN-10 juga memerlukan label ISBN. Hashtag boleh mengandungi huruf Unicode, termasuk bahasa Arab.

Alamat MAC menggunakan enam pasangan yang dipisahkan oleh titik bertindih atau tanda sempang. Alat ini tidak pernah menghubungi alamat atau pengecam yang diekstrak.

Semak nilai dengan halaman sumbernya

Semak kiraan, lompat ke halaman PDF, dan tapis senarai hasil.

Semak dan susun

Setiap hasil merekodkan kedudukan halaman fizikal dalam PDF, yang mungkin berbeza daripada nombor halaman bercetak. Pilih cip halaman untuk membuka pratonton dengan sorotan anggaran.

Alih keluar pendua bermula dalam keadaan didayakan. Kiraan menggabungkan ulangan nilai yang sama yang diiktiraf; matikannya untuk melihat kejadian berasingan. Isih mengikut abjad menukar susunan senarai. Penapisan terpakai pada penyalinan dan Muat turun serta baris yang kelihatan.

Salin nilai atau Muat turun senarai berstruktur

Pilih CSV untuk kiraan dan halaman, atau TXT untuk satu nilai setiap baris.

Apa yang terkandung dalam setiap Muat turun

CSV mengandungi lajur Jenis, Nilai, Kiraan dan Halaman. Pengekodan UTF-8 menyokong bahasa Arab dan skrip lain. Nilai yang boleh ditafsirkan sebagai formula hamparan diawali dengan tanda apostrof untuk import yang lebih selamat.

TXT dan Salin semua hanya mengandungi nilai, satu setiap baris. Semua baris yang sepadan dengan penapis disertakan, walaupun jadual pada skrin merangkumi beberapa halaman hasil. Tiada PDF baharu dicipta dan PDF sumber tidak berubah.

Pastikan pengekstrakan besar boleh diurus

Proses satu PDF dalam pelayar anda, dengan had eksplisit dan notis hasil separa.

Fail, had dan halaman yang diimbas

Muatkan satu PDF sehingga 50 MiB dan 500 halaman. Pengekstrakan menyemak sehingga 250,000 aksara dan 2,000 padanan setiap halaman, 10 juta aksara dan 20,000 padanan secara keseluruhan, serta 2,000 anotasi setiap halaman. Belanjawan pengekstrakan 90 saat mengehadkan larian yang panjang. Dokumen yang sangat kompleks mungkin berfungsi dengan lebih baik apabila dipecahkan kepada fail yang lebih kecil.

Apabila had dicapai atau halaman tidak dapat dibaca sepenuhnya, hasil menunjukkan notis dan larian yang terhad atau gagal akan dieksport dengan partial dalam nama fail. Halaman tanpa teks yang boleh dipilih dikira secara berasingan. Gunakan OCR PDF untuk imbasan imej sahaja, kemudian kembali untuk mengekstrak teks yang dikenali.

Kandungan PDF diproses secara setempat dalam pelayar ini. Dokumen yang dimuat naik tidak dihantar ke pelayan pengekstrakan. Pautan, alamat e-mel dan nombor telefon yang ditemui di dalam PDF tidak pernah dihubungi secara automatik.

Fail & pemprosesan yang disokong

Input
PDF
Output
CSV / TXT

Buka satu PDF sehingga 50 MB dan 750 halaman. Had output, memori dan pemprosesan tambahan mungkin dikenakan pada dokumen yang kompleks.

Pemprosesan berlaku pada peranti anda tanpa memuat naik dokumen. Muat turun hasil anda sebelum menutup halaman; simpan asal secara berasingan.

Advertisements
Soalan Lazim

Beberapa jawapan berguna

Ketahui apa yang diharapkan sebelum anda bermula.

Pada peranti anda
Apakah yang boleh dikenal pasti oleh alat ini?

Pilih jenis data yang anda perlukan: e-mel, nombor telefon, URL, tarikh berangka, alamat IPv4, domain, DOI, ISBN, tanda pagar dan alamat MAC. Semak nilai yang diekstrak dengan kiraan dan rujukan halaman. Ini mengekstrak nilai yang boleh dikenal pasti, bukan jadual, invois atau medan semantik. Corak dan hasil tambah semak mengurangkan gangguan tetapi tidak menjamin kelengkapan atau membuktikan bahawa pengecam adalah tulen.

Bolehkah saya mengekstrak data daripada PDF yang diimbas?

Hanya teks yang boleh dipilih dan sasaran pautan yang dikenal pasti dibaca. Halaman yang hanya mengandungi imej memerlukan OCR PDF terlebih dahulu. Jalankan OCR, muat turun PDF yang boleh dicari, kemudian kembali ke pengekstrak ini.

Bagaimanakah pendua dan kiraan dikendalikan?

Alih keluar pendua menggabungkan nilai setara yang dikenal pasti. Kiraan menunjukkan kejadian yang dikesan dan Halaman menyenaraikan kedudukan halaman PDF fizikal. Lumpuhkan pilihan ini untuk memastikan kejadian kekal berasingan. Sasaran bercetak dan pautan boleh klik yang sepadan pada halaman yang sama tidak dikira dua kali.

Apakah perbezaan antara CSV dan TXT?

CSV merangkumi jenis, nilai, kiraan kejadian dan rujukan halaman. TXT dan Salin semua hanya menyediakan nilai, satu bagi setiap baris. Semua baris yang sepadan dengan penapis semasa disertakan, bukan hanya halaman jadual yang kelihatan.

Adakah PDF dimuat naik untuk pengekstrakan?

Tidak. Penghuraian, pemadanan dan eksport PDF dijalankan dalam pelayar ini. PDF asal tidak berubah. Tiada pautan, e-mel atau nombor telefon yang diekstrak dihubungi secara automatik.

Apakah hadnya?

Satu PDF sehingga 50 MiB dan 500 halaman. Pengekstrakan dihadkan kepada 250,000 aksara teks dan 2,000 padanan setiap halaman, 10 juta aksara dan 20,000 padanan secara keseluruhan, serta 2,000 anotasi setiap halaman. Keputusan membawa notis jika had atau halaman yang tidak boleh dibaca menjadikannya separa.

Teruskan

Apa yang anda ingin lakukan seterusnya?

Pilih alat. PDF siap anda akan dibawa bersama anda.

PDF

Advertisements

Bahasa38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina