Mở PDF sang JSON để xuất các bản ghi trang, khối văn bản và dữ liệu bản vẽ. Tệp PDF bốn trang của chúng tôi tạo ra document.json cùng với một hình ảnh PNG được tham chiếu bên trong tệp ZIP.
Chọn các trang PDF
Tải tệp PDF và để trống Trang cho toàn bộ tài liệu, hoặc nhập tập con bạn cần. Ví dụ của chúng tôi bao gồm tất cả bốn trang.
Xuất và giữ các tài sản cùng nhau
Chọn Bắt đầu. Bản xuất có các tài sản hình ảnh sẽ được tải xuống dưới dạng ZIP. Giải nén toàn bộ tệp lưu trữ và giữ thư mục images bên cạnh document.json.
Mẫu bao gồm images/page-001-image-005.png. Các tham chiếu hình ảnh trỏ đến đường dẫn tài sản thay vì nhúng dữ liệu nhị phân vào JSON. Bản xuất không có tài sản hình ảnh có thể tải xuống trực tiếp dưới dạng .json.
Đọc cấu trúc tài liệu
Mẫu khai báo phiên bản 1, đơn vị pt và gốc tọa độ trên cùng bên trái. Các bản ghi trang bao gồm số trang nguồn, kích thước, xoay, khối và bản vẽ. Tọa độ mô tả trang chưa xoay; hãy tính đến việc xoay khi phủ dữ liệu lên.
Phân tích cú pháp JSON bằng trình phân tích cú pháp JSON. Kiểm tra các khối, dòng và khoảng cách cho văn bản và kiểu dáng, và các giá trị bbox cho hình học. Các đối tượng lồng nhau mô tả bố cục thay vì một chuỗi văn bản đơn lẻ.
Kiểm tra thứ tự đọc và tham chiếu hình ảnh so với tệp PDF gốc trước khi sử dụng dữ liệu trong quy trình xử lý của bạn.
Câu hỏi thường gặp
Tôi có thể xây dựng lại tệp PDF gốc một cách chính xác không?
Đừng giả định việc tái tạo chính xác hoàn toàn. Bản xuất mô tả nội dung và hình học có sẵn, trong khi các tính năng và ngữ nghĩa của PDF có thể phức tạp hơn.
Tại sao tôi nhận được tệp ZIP?
Mẫu có chứa một hình ảnh. ZIP giữ document.json và tài sản được tham chiếu cùng nhau để có thể định vị hình ảnh.
Hãy thử với tài liệu của bạn
Xem lại kết quả, sau đó lưu phiên bản bạn cần.

