Alat150

Tugas PDF yang bermanfaat, dibuat sederhana

Ekstrak Tautan dari PDF.

Ambil tautan yang berguna dari PDF Anda.

Advertisements
Ruang kerja PDF Anda
Di perangkat Anda
atau jatuhkan file Anda di sini
PDF Anda diproses di browser ini. PDF
Advertisements

Cara mengekstrak tautan dari PDF

  1. 01

    Pilih satu PDF

    Muat dokumen dengan teks yang dapat dipilih, atau coba sampelnya.

  2. 02

    Ekstrak dan tinjau

    Pilih Ekstrak. Tinjau nilai, jumlah, dan halaman sumber; saring atau urutkan daftar.

  3. 03

    Salin atau unduh

    Salin nilai, atau unduh CSV dengan referensi halaman atau daftar TXT sederhana.

BlogCara mengekstrak tautan dan URL dari PDFBaca panduan

Ekstrak tautan PDF tanpa membuka setiap halaman

Kumpulkan alamat HTTP/HTTPS, alamat www, dan target tautan web yang dapat diklik dari satu PDF. Simpan referensi halaman dan unduh daftar yang telah dihapus duplikatnya sebagai CSV atau TXT.

Nilai yang dikenali menjadi daftar dengan referensi halaman sumber.
TUTORIAL VIDEO SINGKAT Cara mengekstrak tautan dan URL dari PDF Simpan tautan web yang berguna tanpa membukanya satu per satu. Narasi bahasa Inggris Tonton videonya

Cara mengekstrak tautan dan URL dari PDF

Kapan ini berguna?

Referensi

Kumpulkan tautan sumber

Buat daftar referensi dari laporan dan dokumen penelitian.

Sumber daya

Simpan destinasi yang berguna

Ekstrak destinasi di balik label sumber daya yang dapat diklik.

Tinjauan

Simpan daftar audit

Catat di mana setiap tautan ditemukan sebelum meninjaunya di tempat lain.

Fitur dan kontrol

Temukan tautan yang terlihat dan dapat diklik

Sertakan target tautan bahkan ketika labelnya hanya bertuliskan “Baca selengkapnya”.

Cara kerja ekstraksi tautan

Tautan cetak yang dimulai dengan http://, https://, atau www. akan dikenali. Anotasi tautan PDF juga dapat mengungkapkan target HTTP/HTTPS di balik teks biasa. PDF tidak perlu menampilkan URL sebagai label yang dapat diklik.

Target cetak dan anotasi yang identik pada satu halaman tidak dihitung dua kali. Bentuk URL yang dinormalisasi digunakan untuk perbandingan duplikat, sementara ejaan yang pertama kali dikenali akan ditampilkan. URL yang panjang, terbungkus, atau rusak mungkin memerlukan koreksi manual. Tidak ada URL yang diekstraksi yang diambil secara otomatis.

Tinjau nilai dengan halaman sumbernya

Periksa jumlah, lompat ke halaman PDF, dan filter daftar hasil.

Tinjau dan atur

Setiap hasil mencatat posisi halaman fisik dalam PDF, yang bisa berbeda dari nomor halaman cetak. Pilih chip halaman untuk membuka pratinjau dengan sorotan perkiraan.

Hapus duplikat dimulai dalam keadaan aktif. Jumlah menggabungkan pengulangan nilai yang sama yang dikenali; matikan untuk melihat kejadian terpisah. Urutkan berdasarkan abjad mengubah urutan daftar. Pemfilteran berlaku untuk penyalinan dan pengunduhan serta baris yang terlihat.

Salin nilai atau unduh daftar terstruktur

Pilih CSV untuk jumlah dan halaman, atau TXT untuk satu nilai per baris.

Apa yang terkandung dalam setiap unduhan

CSV berisi kolom Tipe, Nilai, Jumlah, dan Halaman. Pengodean UTF-8 mendukung bahasa Arab dan skrip lainnya. Nilai yang dapat diinterpretasikan sebagai rumus spreadsheet diawali dengan tanda kutip tunggal untuk impor yang lebih aman.

TXT dan Salin semua hanya berisi nilai, satu per baris. Semua baris yang cocok dengan filter disertakan, bahkan ketika tabel di layar mencakup beberapa halaman hasil. Tidak ada PDF baru yang dibuat dan PDF sumber tidak berubah.

Jaga agar ekstraksi besar tetap dapat dikelola

Proses satu PDF di browser Anda, dengan batas eksplisit dan pemberitahuan hasil parsial.

File, batas, dan halaman yang dipindai

Muat satu PDF hingga 50 MiB dan 500 halaman. Ekstraksi memeriksa hingga 250.000 karakter dan 2.000 kecocokan per halaman, 10 juta karakter dan 20.000 kecocokan secara keseluruhan, serta 2.000 anotasi per halaman. Anggaran ekstraksi 90 detik membatasi proses yang panjang. Dokumen yang sangat kompleks mungkin bekerja lebih baik jika dipecah menjadi file yang lebih kecil.

Ketika batas tercapai atau halaman tidak dapat dibaca sepenuhnya, hasil akan menunjukkan pemberitahuan dan ekspor proses yang terbatas atau gagal dengan kata parsial di nama file. Halaman tanpa teks yang dapat dipilih dihitung secara terpisah. Gunakan OCR PDF untuk pemindaian gambar saja, lalu kembali untuk mengekstrak teks yang dikenali.

Konten PDF diproses secara lokal di browser ini. Dokumen yang diunggah tidak dikirim ke server ekstraksi. Tautan, alamat email, dan nomor telepon yang ditemukan di dalam PDF tidak pernah dihubungi secara otomatis.

File & pemrosesan yang didukung

Input
PDF
Output
CSV / TXT

Buka satu PDF hingga 50 MB dan 750 halaman. Batas output, memori, dan pemrosesan tambahan mungkin berlaku untuk dokumen yang kompleks.

Pemrosesan dilakukan di perangkat Anda tanpa mengunggah dokumen. Unduh hasil Anda sebelum menutup halaman; simpan dokumen asli secara terpisah.

Advertisements
FAQ

Beberapa jawaban yang berguna

Ketahui apa yang diharapkan sebelum Anda mulai.

Di perangkat Anda
Apa yang dapat dikenali oleh alat ini?

Kumpulkan alamat HTTP/HTTPS yang dicetak, alamat www, dan target tautan web yang dapat diklik dari satu PDF. Simpan referensi halaman dan unduh daftar yang telah dihapus duplikatnya sebagai CSV atau TXT. Alat ini tidak memeriksa apakah tautan masih berfungsi. Destinasi halaman internal, tindakan JavaScript, mailto, dan skema non-web lainnya tidak diekspor sebagai tautan web.

Bisakah saya mengekstraksi data dari PDF yang dipindai?

Hanya teks yang dapat dipilih dan target tautan yang dikenali yang dibaca. Halaman yang hanya berupa gambar memerlukan OCR PDF terlebih dahulu. Jalankan OCR, unduh PDF yang dapat dicari, lalu kembali ke ekstraktor ini.

Bagaimana duplikat dan jumlah ditangani?

Hapus duplikat menggabungkan nilai setara yang dikenali. Hitungan menunjukkan kemunculan yang terdeteksi dan Halaman mencantumkan posisi fisik halaman PDF. Nonaktifkan opsi ini untuk memisahkan kemunculan. Target yang dicetak dan tautan yang dapat diklik yang cocok pada halaman yang sama tidak dihitung dua kali.

Apa perbedaan antara CSV dan TXT?

CSV menyertakan tipe, nilai, jumlah kemunculan, dan referensi halaman. TXT dan Salin semua hanya menyediakan nilai, satu per baris. Semua baris yang cocok dengan filter saat ini disertakan, bukan hanya halaman tabel yang terlihat.

Apakah PDF diunggah untuk ekstraksi?

Tidak. Penguraian, pencocokan, dan ekspor PDF berjalan di browser ini. PDF asli tidak berubah. Tidak ada tautan, email, atau nomor telepon yang diekstraksi yang dihubungi secara otomatis.

Apa saja batasannya?

Satu PDF hingga 50 MiB dan 500 halaman. Ekstraksi dibatasi hingga 250.000 karakter teks dan 2.000 kecocokan per halaman, 10 juta karakter dan 20.000 kecocokan secara keseluruhan, serta 2.000 anotasi per halaman. Hasil akan menyertakan pemberitahuan jika batasan atau halaman yang tidak dapat dibaca membuatnya menjadi parsial.

Lanjutkan

Apa yang ingin Anda lakukan selanjutnya?

Pilih alat. PDF yang sudah selesai akan ikut dengan Anda.

PDF

Advertisements

Bahasa38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina