Công cụ150

Một tác vụ PDF hữu ích, được thực hiện đơn giản

Trích xuất liên kết từ PDF.

Lấy các liên kết hữu ích từ tệp PDF của bạn.

Advertisements
Không gian làm việc PDF của bạn
Trên thiết bị của bạn
hoặc thả tệp của bạn vào đây
Tệp PDF của bạn được xử lý ngay trong trình duyệt này. PDF
Advertisements

Cách trích xuất liên kết từ PDF

  1. 01

    Chọn một tệp PDF

    Tải lên tài liệu có văn bản chọn được, hoặc thử với tệp mẫu.

  2. 02

    Trích xuất và xem xét

    Chọn Trích xuất. Xem xét các giá trị, số lần xuất hiện và trang nguồn; lọc hoặc sắp xếp danh sách.

  3. 03

    Sao chép hoặc tải xuống

    Sao chép các giá trị, hoặc tải xuống CSV kèm tham chiếu trang hoặc danh sách TXT đơn giản.

BlogCách trích xuất liên kết và URL từ PDFĐọc hướng dẫn

Trích xuất liên kết PDF mà không cần mở từng trang

Thu thập các địa chỉ HTTP/HTTPS được in, địa chỉ www và các đích đến liên kết web có thể nhấp từ một tệp PDF. Giữ lại các tham chiếu trang và Tải xuống danh sách đã loại bỏ trùng lặp dưới dạng CSV hoặc TXT.

Các giá trị được nhận diện sẽ trở thành một danh sách kèm theo tham chiếu trang nguồn.
VIDEO HƯỚNG DẪN NHANH Cách trích xuất liên kết và URL từ PDF Giữ lại các liên kết web hữu ích mà không cần mở từng cái một. Lời bình tiếng Anh Xem video

Cách trích xuất liên kết và URL từ PDF

Khi nào điều này hữu ích?

Tài liệu tham khảo

Thu thập liên kết nguồn

Xây dựng danh sách tham khảo từ các báo cáo và tài liệu nghiên cứu.

Tài nguyên

Lưu các đích đến hữu ích

Trích xuất các đích đến đằng sau các nhãn tài nguyên có thể nhấp.

Xem lại

Giữ danh sách kiểm tra

Ghi lại nơi tìm thấy mỗi liên kết trước khi xem lại ở nơi khác.

Tính năng và điều khiển

Tìm các liên kết hiển thị và có thể nhấp

Bao gồm đích liên kết ngay cả khi nhãn chỉ ghi “Đọc thêm”.

Cách thức hoạt động của trích xuất liên kết

Các liên kết in bắt đầu bằng http://, https:// hoặc www. đều được nhận diện. Các chú thích liên kết PDF cũng có thể tiết lộ đích HTTP/HTTPS đằng sau văn bản thông thường. PDF không cần hiển thị URL dưới dạng nhãn có thể nhấp.

Các đích in và chú thích giống hệt nhau trên một trang không bị tính hai lần. Các dạng URL chuẩn hóa được sử dụng để so sánh trùng lặp, trong khi cách viết được nhận diện đầu tiên sẽ được hiển thị. Các URL dài, bị ngắt dòng hoặc bị hỏng có thể cần chỉnh sửa thủ công. Không có URL nào được trích xuất tự động truy cập.

Xem lại các giá trị cùng với trang nguồn

Kiểm tra số lượng, chuyển đến trang PDF và lọc danh sách kết quả.

Xem lại và sắp xếp

Mỗi kết quả ghi lại vị trí trang vật lý trong PDF, có thể khác với số trang in. Chọn một thẻ trang để mở bản xem trước với phần đánh dấu tương đối.

Tính năng xóa trùng lặp được bật mặc định. Số lượng kết hợp các lần lặp lại của cùng một giá trị; hãy tắt nó để xem các lần xuất hiện riêng biệt. Sắp xếp theo bảng chữ cái thay đổi thứ tự danh sách. Việc lọc áp dụng cho cả sao chép và Tải xuống cũng như các hàng hiển thị.

Sao chép giá trị hoặc Tải xuống danh sách có cấu trúc

Chọn CSV cho số lượng và trang, hoặc TXT cho mỗi giá trị trên một dòng.

Nội dung của mỗi tệp Tải xuống

CSV chứa các cột Loại, Giá trị, Số lượng và Trang. Mã hóa UTF-8 hỗ trợ tiếng Ả Rập và các tập lệnh khác. Các giá trị có thể được hiểu là công thức bảng tính được thêm dấu nháy đơn ở phía trước để nhập an toàn hơn.

TXT và Sao chép tất cả chỉ chứa các giá trị, mỗi giá trị một dòng. Tất cả các hàng khớp với bộ lọc đều được bao gồm, ngay cả khi bảng trên màn hình trải dài trên nhiều trang kết quả. Không có PDF mới nào được tạo và PDF nguồn không thay đổi.

Giữ cho các lần trích xuất lớn ở mức có thể quản lý

Xử lý một PDF trong trình duyệt của bạn, với các giới hạn rõ ràng và thông báo kết quả một phần.

Tệp, giới hạn và trang quét

Tải một PDF lên đến 50 MiB và 500 trang. Trích xuất kiểm tra tối đa 250.000 ký tự và 2.000 kết quả khớp mỗi trang, 10 triệu ký tự và 20.000 kết quả khớp tổng thể, và 2.000 chú thích mỗi trang. Ngân sách trích xuất 90 giây giới hạn các lần chạy dài. Các tài liệu rất phức tạp có thể hoạt động tốt hơn khi được chia thành các tệp nhỏ hơn.

Khi đạt đến giới hạn hoặc một trang không thể đọc đầy đủ, kết quả sẽ hiển thị thông báo và các lần chạy bị giới hạn hoặc thất bại sẽ xuất tệp có chữ partial trong tên tệp. Các trang không có văn bản có thể chọn được tính riêng. Sử dụng PDF OCR cho các bản quét chỉ có hình ảnh, sau đó quay lại để trích xuất văn bản đã nhận diện.

Nội dung PDF được xử lý cục bộ trong trình duyệt này. Các tài liệu đã tải lên không được gửi đến máy chủ trích xuất. Các liên kết, địa chỉ email và số điện thoại được tìm thấy bên trong PDF không bao giờ được tự động liên hệ.

Tệp được hỗ trợ & xử lý

Đầu vào
PDF
Đầu ra
CSV / TXT

Mở một tệp PDF dung lượng tối đa 50 MB và 750 trang. Các giới hạn về đầu ra, bộ nhớ và xử lý bổ sung có thể áp dụng cho các tài liệu phức tạp.

Quá trình xử lý diễn ra trên thiết bị của bạn mà không cần tải tài liệu lên. Hãy tải xuống kết quả trước khi đóng trang; giữ bản gốc riêng biệt.

Advertisements
Câu hỏi thường gặp

Một vài câu trả lời hữu ích

Biết những gì cần mong đợi trước khi bạn bắt đầu.

Trên thiết bị của bạn
Công cụ này có thể nhận dạng những gì?

Thu thập các địa chỉ HTTP/HTTPS được in, địa chỉ www và các mục tiêu liên kết web có thể nhấp từ một tệp PDF. Giữ lại các tham chiếu trang và tải xuống danh sách đã loại bỏ trùng lặp dưới dạng CSV hoặc TXT. Công cụ không kiểm tra xem các liên kết còn hoạt động hay không. Các đích đến trang nội bộ, hành động JavaScript, mailto và các lược đồ không phải web khác sẽ không được xuất dưới dạng liên kết web.

Tôi có thể trích xuất dữ liệu từ các tệp PDF đã quét không?

Chỉ văn bản có thể chọn và mục tiêu liên kết được nhận dạng mới được đọc. Các trang chỉ chứa hình ảnh cần thực hiện OCR PDF trước. Hãy chạy OCR, tải xuống tệp PDF có thể tìm kiếm, sau đó quay lại công cụ trích xuất này.

Các bản sao và số lượng được xử lý như thế nào?

Loại bỏ trùng lặp sẽ kết hợp các giá trị tương đương được nhận dạng. Cột Count hiển thị số lần xuất hiện được phát hiện và Pages liệt kê các vị trí trang PDF vật lý. Tắt tùy chọn này để giữ các lần xuất hiện riêng biệt. Một mục tiêu được in và liên kết có thể nhấp tương ứng trên cùng một trang sẽ không bị tính hai lần.

Sự khác biệt giữa CSV và TXT là gì?

CSV bao gồm loại, giá trị, số lần xuất hiện và tham chiếu trang. TXT và Copy all chỉ cung cấp các giá trị, mỗi giá trị trên một dòng. Tất cả các hàng khớp với bộ lọc hiện tại đều được bao gồm, không chỉ trang bảng đang hiển thị.

PDF có được tải lên để trích xuất không?

Không. Việc phân tích cú pháp, khớp và xuất PDF chạy trong trình duyệt này. PDF gốc không thay đổi. Không có liên kết, email hoặc số điện thoại được trích xuất nào được tự động liên hệ.

Các giới hạn là gì?

Một tệp PDF tối đa 50 MiB và 500 trang. Việc trích xuất giới hạn ở 250.000 ký tự văn bản và 2.000 kết quả khớp mỗi trang, tổng cộng 10 triệu ký tự và 20.000 kết quả khớp, cùng 2.000 chú thích mỗi trang. Kết quả sẽ hiển thị thông báo nếu các giới hạn hoặc trang không thể đọc được khiến dữ liệu bị thiếu một phần.

Tiếp tục

Bạn muốn làm gì tiếp theo?

Chọn một công cụ. PDF hoàn thiện của bạn sẽ đi cùng bạn.

PDF

Advertisements

Ngôn ngữ38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina