Buka Ekstrak Data dari PDF untuk mengumpulkan nilai dari satu PDF tanpa harus menyalinnya baris demi baris. Perbandingan ini menggunakan dokumen sampel nyata dan CSV yang diunduh dari alat tersebut. Dengan email, telepon, URL, DOI, ISBN, dan IPv4 yang dipilih, sampel tiga halaman menghasilkan 11 baris unik dari 15 kemunculan.
Buka PDF Anda
Unggah satu PDF, atau pilih Coba sampel untuk mengikuti contoh ini. Pratinjau PDF dan gambar mini halaman akan muncul. File asli Anda tetap tidak berubah, dan ekstraksi berjalan di browser Anda.
Direktori berbasis teks, laporan, makalah penelitian, atau brosur adalah titik awal yang berguna. Pemindaian yang hanya berupa gambar memerlukan OCR agar teks cetaknya dapat dikenali.
Pilih opsi yang berguna
Di ponsel, buka Pengaturan. Di desktop, gunakan panel pengaturan di samping pratinjau.
Di bawah Apa yang ingin diekstrak, email, nomor telepon, dan URL sudah terpilih. Buka Tipe data lainnya dan pilih juga DOI, ISBN, dan Alamat IPv4. Biarkan penghapusan duplikat tetap aktif dan pilih CSV.
Ekstrak dan periksa kecocokan
Pilih Ekstrak. Setelah pemrosesan selesai, tab Hasil akan menampilkan nilai, jumlah kemunculan, dan halaman sumber. Pilih nomor halaman melingkar untuk memeriksa lokasinya di pratinjau PDF, lalu kembali ke Hasil.
Output menggabungkan daftar kontak dengan DOI 10.1000/182, ISBN 978-0-306-40615-7, dan alamat IPv4 192.0.2.10 dari halaman 2. Kolom Tipe mengidentifikasi setiap nilai. Saring ke kata atau pengenal yang relevan sebelum menyalin atau mengunduh subset yang lebih kecil.
Gunakan Saring hasil untuk mempersempit daftar. Menyalin dan mengunduh akan menyertakan semua baris yang cocok, bahkan ketika tabel hasil mencakup beberapa layar baris.
Unduh CSV atau TXT
Pilih Unduh CSV, lalu gunakan tombol Unduh utama di layar siap. CSV berisi kolom Tipe, Nilai, Jumlah, dan Halaman. TXT dan Salin semua berisi satu nilai per baris.
Nilai CSV yang dapat diartikan sebagai rumus spreadsheet dilindungi dengan tanda kutip tunggal di depan. Misalnya, nomor telepon internasional dimulai dengan tanda plus. Gunakan TXT jika Anda memerlukan daftar polos tanpa perlindungan spreadsheet.
Pertanyaan umum
Apakah ini mengekstrak angka apa pun atau setiap pengenal?
Tidak. Setiap kategori yang dipilih memiliki aturan pengenalannya sendiri. IPv6, persentase, harga, dan nomor kartu pembayaran tidak diekstrak. Tinjau kecocokan terhadap sumber; pemformatan yang valid tidak dapat memastikan bahwa kontak atau pengenal tersebut ada.
Apa yang harus saya lakukan dengan PDF hasil pindaian?
Jalankan OCR PDF terlebih dahulu, lalu muat salinan yang telah dikenali ke dalam alat ini. Periksa output OCR dengan cermat: karakter yang salah dapat mengubah alamat atau pengenal.
Apa saja batasan ekstraksinya?
Gunakan satu PDF hingga 50 MiB dan 750 halaman. Ekstraksi dibatasi hingga 20,000 kecocokan secara keseluruhan dan 2,000 per halaman, dengan anggaran pemrosesan 90 detik. Batasan teks dan anotasi juga berlaku. Jika batasan atau halaman yang tidak dapat dibaca mengganggu pemindaian, alat akan menampilkan pemberitahuan hasil parsial dan menandai nama file ekspor sebagai parsial.
Apakah tautan PDF saya dibuka secara otomatis?
Tidak. Ekstraksi membaca file di browser dan tidak mengunjungi tujuan yang diekstrak. Tombol halaman menavigasi di dalam pratinjau PDF.
Simpan nilai dan konteksnya
Ekstrak daftar yang terfokus, periksa halaman sumber, dan unduh format yang sesuai dengan langkah Anda berikutnya.

