Thu thập liên kết nguồn
Xây dựng danh sách tham khảo từ các báo cáo và tài liệu nghiên cứu.
Lấy các liên kết hữu ích từ tệp PDF của bạn.
| Loại | Giá trị | Số lần | Trang |
|---|
Sao chép và tải xuống bao gồm tất cả các hàng khớp trên mọi trang kết quả. CSV bao gồm số lần xuất hiện và số trang PDF; TXT chỉ chứa các giá trị.
Chọn một số trang trong phần Kết quả để kiểm tra nguồn. Các phần đánh dấu hiển thị vị trí tương đối.
Danh sách của bạn đã sẵn sàng. Hãy tải xuống hoặc quay lại để xem xét và thay đổi định dạng.
Tải lên tài liệu có văn bản chọn được, hoặc thử với tệp mẫu.
Chọn Trích xuất. Xem xét các giá trị, số lần xuất hiện và trang nguồn; lọc hoặc sắp xếp danh sách.
Sao chép các giá trị, hoặc tải xuống CSV kèm tham chiếu trang hoặc danh sách TXT đơn giản.
Thu thập các địa chỉ HTTP/HTTPS được in, địa chỉ www và các đích đến liên kết web có thể nhấp từ một tệp PDF. Giữ lại các tham chiếu trang và Tải xuống danh sách đã loại bỏ trùng lặp dưới dạng CSV hoặc TXT.
Xây dựng danh sách tham khảo từ các báo cáo và tài liệu nghiên cứu.
Trích xuất các đích đến đằng sau các nhãn tài nguyên có thể nhấp.
Ghi lại nơi tìm thấy mỗi liên kết trước khi xem lại ở nơi khác.
Bao gồm đích liên kết ngay cả khi nhãn chỉ ghi “Đọc thêm”.
Các liên kết in bắt đầu bằng http://, https:// hoặc www. đều được nhận diện. Các chú thích liên kết PDF cũng có thể tiết lộ đích HTTP/HTTPS đằng sau văn bản thông thường. PDF không cần hiển thị URL dưới dạng nhãn có thể nhấp.
Các đích in và chú thích giống hệt nhau trên một trang không bị tính hai lần. Các dạng URL chuẩn hóa được sử dụng để so sánh trùng lặp, trong khi cách viết được nhận diện đầu tiên sẽ được hiển thị. Các URL dài, bị ngắt dòng hoặc bị hỏng có thể cần chỉnh sửa thủ công. Không có URL nào được trích xuất tự động truy cập.
Kiểm tra số lượng, chuyển đến trang PDF và lọc danh sách kết quả.
Mỗi kết quả ghi lại vị trí trang vật lý trong PDF, có thể khác với số trang in. Chọn một thẻ trang để mở bản xem trước với phần đánh dấu tương đối.
Tính năng xóa trùng lặp được bật mặc định. Số lượng kết hợp các lần lặp lại của cùng một giá trị; hãy tắt nó để xem các lần xuất hiện riêng biệt. Sắp xếp theo bảng chữ cái thay đổi thứ tự danh sách. Việc lọc áp dụng cho cả sao chép và Tải xuống cũng như các hàng hiển thị.
Chọn CSV cho số lượng và trang, hoặc TXT cho mỗi giá trị trên một dòng.
CSV chứa các cột Loại, Giá trị, Số lượng và Trang. Mã hóa UTF-8 hỗ trợ tiếng Ả Rập và các tập lệnh khác. Các giá trị có thể được hiểu là công thức bảng tính được thêm dấu nháy đơn ở phía trước để nhập an toàn hơn.
TXT và Sao chép tất cả chỉ chứa các giá trị, mỗi giá trị một dòng. Tất cả các hàng khớp với bộ lọc đều được bao gồm, ngay cả khi bảng trên màn hình trải dài trên nhiều trang kết quả. Không có PDF mới nào được tạo và PDF nguồn không thay đổi.
Xử lý một PDF trong trình duyệt của bạn, với các giới hạn rõ ràng và thông báo kết quả một phần.
Tải một PDF lên đến 50 MiB và 500 trang. Trích xuất kiểm tra tối đa 250.000 ký tự và 2.000 kết quả khớp mỗi trang, 10 triệu ký tự và 20.000 kết quả khớp tổng thể, và 2.000 chú thích mỗi trang. Ngân sách trích xuất 90 giây giới hạn các lần chạy dài. Các tài liệu rất phức tạp có thể hoạt động tốt hơn khi được chia thành các tệp nhỏ hơn.
Khi đạt đến giới hạn hoặc một trang không thể đọc đầy đủ, kết quả sẽ hiển thị thông báo và các lần chạy bị giới hạn hoặc thất bại sẽ xuất tệp có chữ partial trong tên tệp. Các trang không có văn bản có thể chọn được tính riêng. Sử dụng PDF OCR cho các bản quét chỉ có hình ảnh, sau đó quay lại để trích xuất văn bản đã nhận diện.
Nội dung PDF được xử lý cục bộ trong trình duyệt này. Các tài liệu đã tải lên không được gửi đến máy chủ trích xuất. Các liên kết, địa chỉ email và số điện thoại được tìm thấy bên trong PDF không bao giờ được tự động liên hệ.
Mở một tệp PDF dung lượng tối đa 50 MB và 750 trang. Các giới hạn về đầu ra, bộ nhớ và xử lý bổ sung có thể áp dụng cho các tài liệu phức tạp.
Quá trình xử lý diễn ra trên thiết bị của bạn mà không cần tải tài liệu lên. Hãy tải xuống kết quả trước khi đóng trang; giữ bản gốc riêng biệt.
Biết những gì cần mong đợi trước khi bạn bắt đầu.
Trên thiết bị của bạnThu thập các địa chỉ HTTP/HTTPS được in, địa chỉ www và các mục tiêu liên kết web có thể nhấp từ một tệp PDF. Giữ lại các tham chiếu trang và tải xuống danh sách đã loại bỏ trùng lặp dưới dạng CSV hoặc TXT. Công cụ không kiểm tra xem các liên kết còn hoạt động hay không. Các đích đến trang nội bộ, hành động JavaScript, mailto và các lược đồ không phải web khác sẽ không được xuất dưới dạng liên kết web.
Chỉ văn bản có thể chọn và mục tiêu liên kết được nhận dạng mới được đọc. Các trang chỉ chứa hình ảnh cần thực hiện OCR PDF trước. Hãy chạy OCR, tải xuống tệp PDF có thể tìm kiếm, sau đó quay lại công cụ trích xuất này.
Loại bỏ trùng lặp sẽ kết hợp các giá trị tương đương được nhận dạng. Cột Count hiển thị số lần xuất hiện được phát hiện và Pages liệt kê các vị trí trang PDF vật lý. Tắt tùy chọn này để giữ các lần xuất hiện riêng biệt. Một mục tiêu được in và liên kết có thể nhấp tương ứng trên cùng một trang sẽ không bị tính hai lần.
CSV bao gồm loại, giá trị, số lần xuất hiện và tham chiếu trang. TXT và Copy all chỉ cung cấp các giá trị, mỗi giá trị trên một dòng. Tất cả các hàng khớp với bộ lọc hiện tại đều được bao gồm, không chỉ trang bảng đang hiển thị.
Không. Việc phân tích cú pháp, khớp và xuất PDF chạy trong trình duyệt này. PDF gốc không thay đổi. Không có liên kết, email hoặc số điện thoại được trích xuất nào được tự động liên hệ.
Một tệp PDF tối đa 50 MiB và 500 trang. Việc trích xuất giới hạn ở 250.000 ký tự văn bản và 2.000 kết quả khớp mỗi trang, tổng cộng 10 triệu ký tự và 20.000 kết quả khớp, cùng 2.000 chú thích mỗi trang. Kết quả sẽ hiển thị thông báo nếu các giới hạn hoặc trang không thể đọc được khiến dữ liệu bị thiếu một phần.
VIDEO HƯỚNG DẪN NHANH
Cách trích xuất liên kết và URL từ PDF
Giữ lại các liên kết web hữu ích mà không cần mở từng cái một.
Lời bình tiếng Anh
Xem video