Mở PDF sang Văn bản, chọn các trang và chọn định dạng tải xuống. Mẫu bốn trang của chúng tôi tạo ra một tệp TXT UTF-8 chứa văn bản trang đã trích xuất.
Tải lên tệp PDF có văn bản sử dụng được
Chọn tệp PDF gốc. Kiểm tra xem văn bản của nó có thể chọn được trong trình xem hay không. Một trang quét chỉ gồm các pixel cần PDF OCR trước khi có thể cung cấp văn bản hữu ích.
Thiết lập các trang và đóng gói
Để trống Trang cho toàn bộ tài liệu hoặc nhập phạm vi cho một phần. Trang hiển thị trong bản xem trước không phải là phạm vi xuất.
Chọn Một tệp văn bản cho tệp TXT kết hợp, như trong ví dụ, hoặc Các tệp riêng biệt cho tệp ZIP chứa các tệp văn bản theo trang và một tệp kết hợp.
Trích xuất và xem lại văn bản
Chọn Bắt đầu và tải xuống. Mẫu tạo ra 3,940 byte, với bốn phần trang được phân tách bằng ký tự ngắt trang.
Mở tệp TXT trong trình soạn thảo văn bản và kiểm tra các cột, chú thích và bảng. Việc trích xuất có thể giữ lại khoảng cách PDF bất thường; hãy làm sạch nó trước khi dán văn bản vào đích đến.
Câu hỏi thường gặp
Tại sao kết quả lại trống đối với bản quét của tôi?
Trang có thể chỉ chứa hình ảnh. Sử dụng PDF OCR để nhận dạng các từ; công cụ này trích xuất lớp văn bản hiện có.
Công cụ nào tốt hơn cho tiêu đề và ghi chú?
Hãy thử PDF sang Markdown khi các tiêu đề và đoạn văn hữu ích hơn TXT thuần túy. Hãy xem lại cấu trúc được suy luận của nó nữa.
Thử với tài liệu của bạn
Xem lại kết quả, sau đó lưu phiên bản bạn cần.

