Buka PDF ke XML untuk mengekspor catatan halaman, blok teks, dan data gambar. PDF empat halaman kami menghasilkan document.xml ditambah satu gambar PNG yang direferensikan di dalam ZIP.
Pilih halaman PDF
Muat PDF dan biarkan Halaman kosong untuk seluruh dokumen, atau masukkan subset yang Anda perlukan. Contoh kami mencakup keempat halaman.
Ekspor dan simpan aset bersama-sama
Pilih Mulai. Ekspor dengan aset gambar akan diunduh sebagai ZIP. Ekstrak seluruh arsip dan simpan direktori images di samping document.xml.
Sampel tersebut mencakup images/page-001-image-005.png. Referensi gambar mengarah ke jalur aset alih-alih menyematkan data biner dalam XML. Ekspor tanpa aset gambar dapat diunduh langsung sebagai .xml.
Baca struktur dokumen
Sampel tersebut menyatakan versi 1, unit pt, dan asal kiri-atas. Catatan halaman mencakup nomor halaman sumber, dimensi, rotasi, blok, dan gambar. Koordinat menjelaskan halaman yang tidak diputar; perhitungkan rotasi saat menumpuk data.
Urai XML dengan pengurai XML. Nilai berulang menggunakan elemen item; beberapa tupel geometris adalah nilai teks. Periksa struktur sebenarnya alih-alih mengasumsikan skema penerbitan seperti DocBook.
Periksa urutan baca dan referensi gambar terhadap PDF asli sebelum menggunakan data dalam alur kerja pemrosesan Anda.
Pertanyaan umum
Apakah XML berisi bab semantik?
Ini menjelaskan data halaman yang diekstraksi. Makna judul, urutan baca, dan semantik dokumen mungkin memerlukan interpretasi Anda sendiri.
Mengapa saya menerima ZIP?
Sampel berisi gambar. ZIP menyimpan document.xml dan aset yang direferensikan bersama-sama agar gambar dapat ditemukan.
Coba dengan dokumen Anda
Tinjau hasilnya, lalu simpan versi yang Anda perlukan.

