Công cụ150

Một tác vụ PDF hữu ích, được thực hiện đơn giản

Trích xuất dữ liệu từ PDF.

Tìm dữ liệu bạn cần. Giữ lại trang nguồn cùng với mỗi kết quả.

Advertisements
Không gian làm việc PDF của bạn
Trên thiết bị của bạn
hoặc thả tệp của bạn vào đây
Tệp PDF của bạn được xử lý ngay trong trình duyệt này. PDF
Advertisements

Cách trích xuất dữ liệu từ PDF

  1. 01

    Chọn một tệp PDF

    Tải lên tài liệu có văn bản chọn được, hoặc thử với tệp mẫu.

  2. 02

    Trích xuất và xem xét

    Chọn Trích xuất. Xem xét các giá trị, số lần xuất hiện và trang nguồn; lọc hoặc sắp xếp danh sách.

  3. 03

    Sao chép hoặc tải xuống

    Sao chép các giá trị, hoặc tải xuống CSV kèm tham chiếu trang hoặc danh sách TXT đơn giản.

BlogCách trích xuất dữ liệu có cấu trúc từ tệp PDFĐọc hướng dẫn

Trích xuất các giá trị có cấu trúc từ PDF sang CSV hoặc văn bản

Chọn các loại dữ liệu bạn cần: email, số điện thoại, URL, ngày tháng dạng số, địa chỉ IPv4, tên miền, DOI, ISBN, hashtag và địa chỉ MAC. Xem lại các giá trị đã trích xuất cùng với số lượng và tham chiếu trang.

Các giá trị được nhận diện sẽ trở thành một danh sách kèm theo tham chiếu trang nguồn.
VIDEO HƯỚNG DẪN NHANH Cách trích xuất dữ liệu có cấu trúc từ tệp PDF Thu thập danh bạ và mã định danh nghiên cứu vào một danh sách có tổ chức. Lời bình tiếng Anh Xem video

Cách trích xuất dữ liệu có cấu trúc từ tệp PDF

Khi nào điều này hữu ích?

Nghiên cứu

Thu thập định danh

Thu thập các giá trị DOI và ISBN cùng với các trang nơi chúng xuất hiện.

Báo cáo

Trích xuất các chi tiết dạng số

Tìm các mục có ngày tháng và địa chỉ IPv4.

Danh mục

Xây dựng danh sách liên hệ

Kết hợp email, số điện thoại và liên kết web vào một tệp xuất có cấu trúc.

Tính năng và điều khiển

Chọn các loại dữ liệu hữu ích

Bắt đầu với email, số điện thoại và URL, sau đó mở Thêm loại dữ liệu cho các giá trị chuyên biệt.

Những gì bộ nhận diện hỗ trợ

Ngày tháng phải sử dụng định dạng số với năm bốn chữ số; các giá trị ngày/tháng mơ hồ giữ nguyên thứ tự nguồn. Các octet IPv4 được xác thực; IPv6 không được bao gồm.

Tên miền được suy ra từ email và liên kết web được nhận diện, không phải tên tệp tùy ý. Trích xuất DOI bao gồm các dạng DOI hiện đại phổ biến, không phải mọi dạng lịch sử. Các giá trị ISBN-13 cần tổng kiểm tra hợp lệ; ISBN-10 cũng cần nhãn ISBN. Hashtag có thể chứa các chữ cái Unicode, bao gồm cả tiếng Ả Rập.

Địa chỉ MAC sử dụng sáu cặp được phân tách bằng dấu hai chấm hoặc dấu gạch nối. Công cụ không bao giờ liên hệ với các địa chỉ hoặc định danh được trích xuất.

Xem lại các giá trị cùng với trang nguồn

Kiểm tra số lượng, chuyển đến trang PDF và lọc danh sách kết quả.

Xem lại và sắp xếp

Mỗi kết quả ghi lại vị trí trang vật lý trong PDF, có thể khác với số trang in. Chọn một thẻ trang để mở bản xem trước với phần đánh dấu tương đối.

Tính năng xóa trùng lặp được bật mặc định. Số lượng kết hợp các lần lặp lại của cùng một giá trị; hãy tắt nó để xem các lần xuất hiện riêng biệt. Sắp xếp theo bảng chữ cái thay đổi thứ tự danh sách. Việc lọc áp dụng cho cả sao chép và Tải xuống cũng như các hàng hiển thị.

Sao chép giá trị hoặc Tải xuống danh sách có cấu trúc

Chọn CSV cho số lượng và trang, hoặc TXT cho mỗi giá trị trên một dòng.

Nội dung của mỗi tệp Tải xuống

CSV chứa các cột Loại, Giá trị, Số lượng và Trang. Mã hóa UTF-8 hỗ trợ tiếng Ả Rập và các tập lệnh khác. Các giá trị có thể được hiểu là công thức bảng tính được thêm dấu nháy đơn ở phía trước để nhập an toàn hơn.

TXT và Sao chép tất cả chỉ chứa các giá trị, mỗi giá trị một dòng. Tất cả các hàng khớp với bộ lọc đều được bao gồm, ngay cả khi bảng trên màn hình trải dài trên nhiều trang kết quả. Không có PDF mới nào được tạo và PDF nguồn không thay đổi.

Giữ cho các lần trích xuất lớn ở mức có thể quản lý

Xử lý một PDF trong trình duyệt của bạn, với các giới hạn rõ ràng và thông báo kết quả một phần.

Tệp, giới hạn và trang quét

Tải một PDF lên đến 50 MiB và 500 trang. Trích xuất kiểm tra tối đa 250.000 ký tự và 2.000 kết quả khớp mỗi trang, 10 triệu ký tự và 20.000 kết quả khớp tổng thể, và 2.000 chú thích mỗi trang. Ngân sách trích xuất 90 giây giới hạn các lần chạy dài. Các tài liệu rất phức tạp có thể hoạt động tốt hơn khi được chia thành các tệp nhỏ hơn.

Khi đạt đến giới hạn hoặc một trang không thể đọc đầy đủ, kết quả sẽ hiển thị thông báo và các lần chạy bị giới hạn hoặc thất bại sẽ xuất tệp có chữ partial trong tên tệp. Các trang không có văn bản có thể chọn được tính riêng. Sử dụng PDF OCR cho các bản quét chỉ có hình ảnh, sau đó quay lại để trích xuất văn bản đã nhận diện.

Nội dung PDF được xử lý cục bộ trong trình duyệt này. Các tài liệu đã tải lên không được gửi đến máy chủ trích xuất. Các liên kết, địa chỉ email và số điện thoại được tìm thấy bên trong PDF không bao giờ được tự động liên hệ.

Tệp được hỗ trợ & xử lý

Đầu vào
PDF
Đầu ra
CSV / TXT

Mở một tệp PDF dung lượng tối đa 50 MB và 750 trang. Các giới hạn về đầu ra, bộ nhớ và xử lý bổ sung có thể áp dụng cho các tài liệu phức tạp.

Quá trình xử lý diễn ra trên thiết bị của bạn mà không cần tải tài liệu lên. Hãy tải xuống kết quả trước khi đóng trang; giữ bản gốc riêng biệt.

Advertisements
Câu hỏi thường gặp

Một vài câu trả lời hữu ích

Biết những gì cần mong đợi trước khi bạn bắt đầu.

Trên thiết bị của bạn
Công cụ này có thể nhận dạng những gì?

Chọn các loại dữ liệu bạn cần: email, số điện thoại, URL, ngày tháng dạng số, địa chỉ IPv4, tên miền, DOI, ISBN, hashtag và địa chỉ MAC. Xem lại các giá trị đã trích xuất cùng với số lượng và tham chiếu trang. Công cụ này trích xuất các giá trị có thể nhận dạng, không phải bảng biểu, hóa đơn hoặc các trường ngữ nghĩa. Các mẫu và tổng kiểm tra giúp giảm nhiễu nhưng không đảm bảo tính đầy đủ hoặc chứng minh rằng một định danh là xác thực.

Tôi có thể trích xuất dữ liệu từ các tệp PDF đã quét không?

Chỉ văn bản có thể chọn và mục tiêu liên kết được nhận dạng mới được đọc. Các trang chỉ chứa hình ảnh cần thực hiện OCR PDF trước. Hãy chạy OCR, tải xuống tệp PDF có thể tìm kiếm, sau đó quay lại công cụ trích xuất này.

Các bản sao và số lượng được xử lý như thế nào?

Loại bỏ trùng lặp sẽ kết hợp các giá trị tương đương được nhận dạng. Cột Count hiển thị số lần xuất hiện được phát hiện và Pages liệt kê các vị trí trang PDF vật lý. Tắt tùy chọn này để giữ các lần xuất hiện riêng biệt. Một mục tiêu được in và liên kết có thể nhấp tương ứng trên cùng một trang sẽ không bị tính hai lần.

Sự khác biệt giữa CSV và TXT là gì?

CSV bao gồm loại, giá trị, số lần xuất hiện và tham chiếu trang. TXT và Copy all chỉ cung cấp các giá trị, mỗi giá trị trên một dòng. Tất cả các hàng khớp với bộ lọc hiện tại đều được bao gồm, không chỉ trang bảng đang hiển thị.

PDF có được tải lên để trích xuất không?

Không. Việc phân tích cú pháp, khớp và xuất PDF chạy trong trình duyệt này. PDF gốc không thay đổi. Không có liên kết, email hoặc số điện thoại được trích xuất nào được tự động liên hệ.

Các giới hạn là gì?

Một tệp PDF tối đa 50 MiB và 500 trang. Việc trích xuất giới hạn ở 250.000 ký tự văn bản và 2.000 kết quả khớp mỗi trang, tổng cộng 10 triệu ký tự và 20.000 kết quả khớp, cùng 2.000 chú thích mỗi trang. Kết quả sẽ hiển thị thông báo nếu các giới hạn hoặc trang không thể đọc được khiến dữ liệu bị thiếu một phần.

Tiếp tục

Bạn muốn làm gì tiếp theo?

Chọn một công cụ. PDF hoàn thiện của bạn sẽ đi cùng bạn.

PDF

Advertisements

Ngôn ngữ38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina