Alat150

Tugas PDF yang bermanfaat, dibuat sederhana

Ekstrak Data dari PDF.

Temukan data yang Anda butuhkan. Simpan halaman sumber dengan setiap hasil.

Advertisements
Ruang kerja PDF Anda
Di perangkat Anda
atau jatuhkan file Anda di sini
PDF Anda diproses di browser ini. PDF
Advertisements

Cara mengekstrak data dari PDF

  1. 01

    Pilih satu PDF

    Muat dokumen dengan teks yang dapat dipilih, atau coba sampelnya.

  2. 02

    Ekstrak dan tinjau

    Pilih Ekstrak. Tinjau nilai, jumlah, dan halaman sumber; saring atau urutkan daftar.

  3. 03

    Salin atau unduh

    Salin nilai, atau unduh CSV dengan referensi halaman atau daftar TXT sederhana.

BlogCara mengekstrak data terstruktur dari PDFBaca panduan

Ekstrak nilai terstruktur dari PDF ke dalam CSV atau teks

Pilih jenis data yang Anda butuhkan: email, nomor telepon, URL, tanggal numerik, alamat IPv4, domain, DOI, ISBN, tagar, dan alamat MAC. Tinjau nilai yang diekstraksi dengan jumlah dan referensi halaman.

Nilai yang dikenali menjadi daftar dengan referensi halaman sumber.
TUTORIAL VIDEO SINGKAT Cara mengekstrak data terstruktur dari PDF Kumpulkan kontak dan pengidentifikasi penelitian dalam satu daftar terorganisir. Narasi bahasa Inggris Tonton videonya

Cara mengekstrak data terstruktur dari PDF

Kapan ini berguna?

Penelitian

Kumpulkan pengenal

Kumpulkan nilai DOI dan ISBN beserta halaman tempat mereka muncul.

Laporan

Tarik detail numerik

Temukan entri bertanggal dan alamat IPv4.

Direktori

Bangun daftar kontak

Gabungkan email, telepon, dan tautan web dalam satu ekspor terstruktur.

Fitur dan kontrol

Pilih tipe data yang berguna

Mulai dengan email, telepon, dan URL, lalu buka Tipe data lainnya untuk nilai khusus.

Apa yang didukung oleh pengenal

Tanggal harus menggunakan format numerik dengan tahun empat digit; nilai hari/bulan yang ambigu mempertahankan urutan sumbernya. Oktet IPv4 divalidasi; IPv6 tidak disertakan.

Domain berasal dari email dan tautan web yang dikenali, bukan nama file arbitrer. Ekstraksi DOI mencakup bentuk DOI modern yang umum, bukan setiap bentuk historis. Nilai ISBN-13 memerlukan checksum yang valid; ISBN-10 juga memerlukan label ISBN. Tagar dapat berisi huruf Unicode, termasuk bahasa Arab.

Alamat MAC menggunakan enam pasangan yang dipisahkan oleh titik dua atau tanda hubung. Alat ini tidak pernah menghubungi alamat atau pengenal yang diekstraksi.

Tinjau nilai dengan halaman sumbernya

Periksa jumlah, lompat ke halaman PDF, dan filter daftar hasil.

Tinjau dan atur

Setiap hasil mencatat posisi halaman fisik dalam PDF, yang bisa berbeda dari nomor halaman cetak. Pilih chip halaman untuk membuka pratinjau dengan sorotan perkiraan.

Hapus duplikat dimulai dalam keadaan aktif. Jumlah menggabungkan pengulangan nilai yang sama yang dikenali; matikan untuk melihat kejadian terpisah. Urutkan berdasarkan abjad mengubah urutan daftar. Pemfilteran berlaku untuk penyalinan dan pengunduhan serta baris yang terlihat.

Salin nilai atau unduh daftar terstruktur

Pilih CSV untuk jumlah dan halaman, atau TXT untuk satu nilai per baris.

Apa yang terkandung dalam setiap unduhan

CSV berisi kolom Tipe, Nilai, Jumlah, dan Halaman. Pengodean UTF-8 mendukung bahasa Arab dan skrip lainnya. Nilai yang dapat diinterpretasikan sebagai rumus spreadsheet diawali dengan tanda kutip tunggal untuk impor yang lebih aman.

TXT dan Salin semua hanya berisi nilai, satu per baris. Semua baris yang cocok dengan filter disertakan, bahkan ketika tabel di layar mencakup beberapa halaman hasil. Tidak ada PDF baru yang dibuat dan PDF sumber tidak berubah.

Jaga agar ekstraksi besar tetap dapat dikelola

Proses satu PDF di browser Anda, dengan batas eksplisit dan pemberitahuan hasil parsial.

File, batas, dan halaman yang dipindai

Muat satu PDF hingga 50 MiB dan 500 halaman. Ekstraksi memeriksa hingga 250.000 karakter dan 2.000 kecocokan per halaman, 10 juta karakter dan 20.000 kecocokan secara keseluruhan, serta 2.000 anotasi per halaman. Anggaran ekstraksi 90 detik membatasi proses yang panjang. Dokumen yang sangat kompleks mungkin bekerja lebih baik jika dipecah menjadi file yang lebih kecil.

Ketika batas tercapai atau halaman tidak dapat dibaca sepenuhnya, hasil akan menunjukkan pemberitahuan dan ekspor proses yang terbatas atau gagal dengan kata parsial di nama file. Halaman tanpa teks yang dapat dipilih dihitung secara terpisah. Gunakan OCR PDF untuk pemindaian gambar saja, lalu kembali untuk mengekstrak teks yang dikenali.

Konten PDF diproses secara lokal di browser ini. Dokumen yang diunggah tidak dikirim ke server ekstraksi. Tautan, alamat email, dan nomor telepon yang ditemukan di dalam PDF tidak pernah dihubungi secara otomatis.

File & pemrosesan yang didukung

Input
PDF
Output
CSV / TXT

Buka satu PDF hingga 50 MB dan 750 halaman. Batas output, memori, dan pemrosesan tambahan mungkin berlaku untuk dokumen yang kompleks.

Pemrosesan dilakukan di perangkat Anda tanpa mengunggah dokumen. Unduh hasil Anda sebelum menutup halaman; simpan dokumen asli secara terpisah.

Advertisements
FAQ

Beberapa jawaban yang berguna

Ketahui apa yang diharapkan sebelum Anda mulai.

Di perangkat Anda
Apa yang dapat dikenali oleh alat ini?

Pilih tipe data yang Anda butuhkan: email, nomor telepon, URL, tanggal numerik, alamat IPv4, domain, DOI, ISBN, tagar, dan alamat MAC. Tinjau nilai yang diekstraksi dengan jumlah dan referensi halaman. Ini mengekstraksi nilai yang dapat dikenali, bukan tabel, faktur, atau bidang semantik. Pola dan checksum mengurangi gangguan tetapi tidak menjamin kelengkapan atau membuktikan bahwa pengenal tersebut asli.

Bisakah saya mengekstraksi data dari PDF yang dipindai?

Hanya teks yang dapat dipilih dan target tautan yang dikenali yang dibaca. Halaman yang hanya berupa gambar memerlukan OCR PDF terlebih dahulu. Jalankan OCR, unduh PDF yang dapat dicari, lalu kembali ke ekstraktor ini.

Bagaimana duplikat dan jumlah ditangani?

Hapus duplikat menggabungkan nilai setara yang dikenali. Hitungan menunjukkan kemunculan yang terdeteksi dan Halaman mencantumkan posisi fisik halaman PDF. Nonaktifkan opsi ini untuk memisahkan kemunculan. Target yang dicetak dan tautan yang dapat diklik yang cocok pada halaman yang sama tidak dihitung dua kali.

Apa perbedaan antara CSV dan TXT?

CSV menyertakan tipe, nilai, jumlah kemunculan, dan referensi halaman. TXT dan Salin semua hanya menyediakan nilai, satu per baris. Semua baris yang cocok dengan filter saat ini disertakan, bukan hanya halaman tabel yang terlihat.

Apakah PDF diunggah untuk ekstraksi?

Tidak. Penguraian, pencocokan, dan ekspor PDF berjalan di browser ini. PDF asli tidak berubah. Tidak ada tautan, email, atau nomor telepon yang diekstraksi yang dihubungi secara otomatis.

Apa saja batasannya?

Satu PDF hingga 50 MiB dan 500 halaman. Ekstraksi dibatasi hingga 250.000 karakter teks dan 2.000 kecocokan per halaman, 10 juta karakter dan 20.000 kecocokan secara keseluruhan, serta 2.000 anotasi per halaman. Hasil akan menyertakan pemberitahuan jika batasan atau halaman yang tidak dapat dibaca membuatnya menjadi parsial.

Lanjutkan

Apa yang ingin Anda lakukan selanjutnya?

Pilih alat. PDF yang sudah selesai akan ikut dengan Anda.

PDF

Advertisements

Bahasa38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina