Alatan150

Tugas PDF yang berguna, dipermudahkan

Ekstrak Pautan daripada PDF.

Keluarkan pautan berguna daripada PDF anda.

Advertisements
Ruang kerja PDF anda
Pada peranti anda
atau lepaskan fail anda di sini
PDF anda diproses dalam pelayar ini. PDF
Advertisements

Cara mengekstrak pautan daripada pdf

  1. 01

    Pilih satu PDF

    Muatkan dokumen dengan teks yang boleh dipilih, atau cuba sampel.

  2. 02

    Ekstrak dan semak

    Pilih Ekstrak. Semak nilai, kiraan dan halaman sumber; tapis atau isih senarai.

  3. 03

    Salin atau muat turun

    Salin nilai, atau muat turun CSV dengan rujukan halaman atau senarai TXT ringkas.

BlogCara mengekstrak pautan dan URL daripada PDFBaca panduan

Ekstrak pautan PDF tanpa membuka setiap halaman

Kumpul alamat HTTP/HTTPS bercetak, alamat www, dan sasaran pautan web yang boleh diklik daripada satu PDF. Simpan rujukan halaman dan Muat turun senarai yang telah dinyahduplikasi sebagai CSV atau TXT.

Nilai yang diiktiraf menjadi senarai dengan rujukan halaman sumber.
TUTORIAL VIDEO PANTAS Cara mengekstrak pautan dan URL daripada PDF Simpan pautan web yang berguna tanpa membukanya satu demi satu. Narasi bahasa Inggeris Tonton video

Cara mengekstrak pautan dan URL daripada PDF

Bilakah ini berguna?

Rujukan

Kumpul pautan sumber

Bina senarai rujukan daripada laporan dan dokumen penyelidikan.

Sumber

Simpan destinasi berguna

Ekstrak destinasi di sebalik label sumber yang boleh diklik.

Semakan

Simpan senarai audit

Rekod di mana setiap pautan ditemui sebelum menyemaknya di tempat lain.

Ciri dan kawalan

Cari pautan yang kelihatan dan boleh diklik

Sertakan sasaran pautan walaupun labelnya hanya menyatakan “Baca lagi”.

Bagaimana pengekstrakan pautan berfungsi

Pautan bercetak yang bermula dengan http://, https:// atau www. diiktiraf. Anotasi pautan PDF juga boleh mendedahkan sasaran HTTP/HTTPS di sebalik teks biasa. PDF tidak perlu memaparkan URL sebagai label yang boleh diklik.

Sasaran bercetak dan anotasi yang serupa pada satu halaman tidak dikira dua kali. Bentuk URL yang dinormalkan digunakan untuk perbandingan pendua, manakala ejaan yang pertama diiktiraf dipaparkan. URL yang panjang, dibalut atau rosak mungkin memerlukan pembetulan manual. Tiada URL yang diekstrak diambil secara automatik.

Semak nilai dengan halaman sumbernya

Semak kiraan, lompat ke halaman PDF, dan tapis senarai hasil.

Semak dan susun

Setiap hasil merekodkan kedudukan halaman fizikal dalam PDF, yang mungkin berbeza daripada nombor halaman bercetak. Pilih cip halaman untuk membuka pratonton dengan sorotan anggaran.

Alih keluar pendua bermula dalam keadaan didayakan. Kiraan menggabungkan ulangan nilai yang sama yang diiktiraf; matikannya untuk melihat kejadian berasingan. Isih mengikut abjad menukar susunan senarai. Penapisan terpakai pada penyalinan dan Muat turun serta baris yang kelihatan.

Salin nilai atau Muat turun senarai berstruktur

Pilih CSV untuk kiraan dan halaman, atau TXT untuk satu nilai setiap baris.

Apa yang terkandung dalam setiap Muat turun

CSV mengandungi lajur Jenis, Nilai, Kiraan dan Halaman. Pengekodan UTF-8 menyokong bahasa Arab dan skrip lain. Nilai yang boleh ditafsirkan sebagai formula hamparan diawali dengan tanda apostrof untuk import yang lebih selamat.

TXT dan Salin semua hanya mengandungi nilai, satu setiap baris. Semua baris yang sepadan dengan penapis disertakan, walaupun jadual pada skrin merangkumi beberapa halaman hasil. Tiada PDF baharu dicipta dan PDF sumber tidak berubah.

Pastikan pengekstrakan besar boleh diurus

Proses satu PDF dalam pelayar anda, dengan had eksplisit dan notis hasil separa.

Fail, had dan halaman yang diimbas

Muatkan satu PDF sehingga 50 MiB dan 500 halaman. Pengekstrakan menyemak sehingga 250,000 aksara dan 2,000 padanan setiap halaman, 10 juta aksara dan 20,000 padanan secara keseluruhan, serta 2,000 anotasi setiap halaman. Belanjawan pengekstrakan 90 saat mengehadkan larian yang panjang. Dokumen yang sangat kompleks mungkin berfungsi dengan lebih baik apabila dipecahkan kepada fail yang lebih kecil.

Apabila had dicapai atau halaman tidak dapat dibaca sepenuhnya, hasil menunjukkan notis dan larian yang terhad atau gagal akan dieksport dengan partial dalam nama fail. Halaman tanpa teks yang boleh dipilih dikira secara berasingan. Gunakan OCR PDF untuk imbasan imej sahaja, kemudian kembali untuk mengekstrak teks yang dikenali.

Kandungan PDF diproses secara setempat dalam pelayar ini. Dokumen yang dimuat naik tidak dihantar ke pelayan pengekstrakan. Pautan, alamat e-mel dan nombor telefon yang ditemui di dalam PDF tidak pernah dihubungi secara automatik.

Fail & pemprosesan yang disokong

Input
PDF
Output
CSV / TXT

Buka satu PDF sehingga 50 MB dan 750 halaman. Had output, memori dan pemprosesan tambahan mungkin dikenakan pada dokumen yang kompleks.

Pemprosesan berlaku pada peranti anda tanpa memuat naik dokumen. Muat turun hasil anda sebelum menutup halaman; simpan asal secara berasingan.

Advertisements
Soalan Lazim

Beberapa jawapan berguna

Ketahui apa yang diharapkan sebelum anda bermula.

Pada peranti anda
Apakah yang boleh dikenal pasti oleh alat ini?

Kumpul alamat HTTP/HTTPS bercetak, alamat www dan sasaran pautan web boleh klik daripada satu PDF. Simpan rujukan halaman dan muat turun senarai yang telah dinyahduplikasi sebagai CSV atau TXT. Alat ini tidak menyemak sama ada pautan masih berfungsi. Destinasi halaman dalaman, tindakan JavaScript, mailto dan skema bukan web lain tidak dieksport sebagai pautan web.

Bolehkah saya mengekstrak data daripada PDF yang diimbas?

Hanya teks yang boleh dipilih dan sasaran pautan yang dikenal pasti dibaca. Halaman yang hanya mengandungi imej memerlukan OCR PDF terlebih dahulu. Jalankan OCR, muat turun PDF yang boleh dicari, kemudian kembali ke pengekstrak ini.

Bagaimanakah pendua dan kiraan dikendalikan?

Alih keluar pendua menggabungkan nilai setara yang dikenal pasti. Kiraan menunjukkan kejadian yang dikesan dan Halaman menyenaraikan kedudukan halaman PDF fizikal. Lumpuhkan pilihan ini untuk memastikan kejadian kekal berasingan. Sasaran bercetak dan pautan boleh klik yang sepadan pada halaman yang sama tidak dikira dua kali.

Apakah perbezaan antara CSV dan TXT?

CSV merangkumi jenis, nilai, kiraan kejadian dan rujukan halaman. TXT dan Salin semua hanya menyediakan nilai, satu bagi setiap baris. Semua baris yang sepadan dengan penapis semasa disertakan, bukan hanya halaman jadual yang kelihatan.

Adakah PDF dimuat naik untuk pengekstrakan?

Tidak. Penghuraian, pemadanan dan eksport PDF dijalankan dalam pelayar ini. PDF asal tidak berubah. Tiada pautan, e-mel atau nombor telefon yang diekstrak dihubungi secara automatik.

Apakah hadnya?

Satu PDF sehingga 50 MiB dan 500 halaman. Pengekstrakan dihadkan kepada 250,000 aksara teks dan 2,000 padanan setiap halaman, 10 juta aksara dan 20,000 padanan secara keseluruhan, serta 2,000 anotasi setiap halaman. Keputusan membawa notis jika had atau halaman yang tidak boleh dibaca menjadikannya separa.

Teruskan

Apa yang anda ingin lakukan seterusnya?

Pilih alat. PDF siap anda akan dibawa bersama anda.

PDF

Advertisements

Bahasa38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina