Masukkan ke alur kerja pemrosesan XML
Ekspor konten halaman sebagai XML untuk skrip atau aplikasi yang memahami struktur output yang didokumentasikan.
Ekspor teks, gambar, dan geometri gambar PDF sebagai XML.
Gunakan kontrol halaman untuk memeriksa dokumen Anda.
Unduh hasil Anda, atau kembali ke pengaturan untuk membuat versi lain.
Unggah satu PDF dari perangkat Anda.
Tinjau pengaturan yang tersedia, lalu mulai pemrosesan.
Simpan hasil dan periksa sebelum membagikannya.
Ekspor teks, gambar, dan geometri gambar PDF sebagai XML. Pilih halaman dan unduh deskripsi terstruktur, dengan aset gambar yang dikemas bersamanya saat diperlukan.
Ekspor konten halaman sebagai XML untuk skrip atau aplikasi yang memahami struktur output yang didokumentasikan.
Gunakan koordinat konten untuk mempelajari tata letak halaman; koordinat tersebut merujuk pada halaman PDF yang tidak diputar, bukan piksel browser.
Tinjau objek yang diekstraksi sebelum membuat aturan penguraian khusus dokumen. Pemindaian memerlukan OCR untuk teks yang dikenali.
Dapatkan deskripsi terstruktur dari konten halaman alih-alih transkrip biasa.
Struktur berversi mencakup halaman, blok teks dan rentang, font, kotak pembatas, dan jalur gambar vektor. Koordinat berada dalam poin PDF dari asal kiri atas halaman yang tidak diputar; rotasi dicatat secara terpisah. Ini dapat mendukung pengindeksan atau analisis dokumen, tetapi konverter tidak menyimpulkan skema bisnis atau nama bidang semantik Anda sendiri.
Terima file data langsung atau ZIP saat gambar yang diekstrak disertakan.
Saat halaman berisi data gambar, arsip berisi document.json atau document.xml ditambah file gambar yang direferensikan dan masker apa pun yang didukung. Simpan jalur tersebut bersama-sama saat memuat data di tempat lain. Pemindaian khusus gambar tetap berupa data gambar; ekspor ini tidak melakukan OCR untuk membuat rentang teks yang hilang.
Proses seluruh dokumen atau masukkan nomor halaman dan rentang tertentu.
Gunakan posisi PDF, dimulai dari 1, alih-alih angka yang tercetak di halaman. Daftar seperti 1, 3-5 mencakup empat halaman. Rentang kosong menggunakan setiap halaman. Periksa pratinjau saat dokumen menyertakan sampul atau bab dengan penomoran berbeda. Hanya halaman yang dipilih yang disertakan dalam konversi ini.
Ekstraksi teks membaca lapisan teks; ini tidak mengenali huruf dalam gambar.
Ekstraksi menggunakan lapisan teks yang ada dan tidak mengenali huruf dalam gambar halaman. Jika halaman tidak memiliki teks yang dapat dibaca, gunakan PDF OCR secara terpisah. Halaman kosong juga dapat menghasilkan teks kosong. Untuk PDF campuran, periksa halaman kosong atau tidak terbaca secara individual. OCR memproses satu halaman yang dipilih sekaligus.
Buka satu PDF hingga 100 MB dan 750 halaman sumber. File yang dilindungi memerlukan salinan yang tidak terkunci kecuali alat ini secara eksplisit menawarkan entri kata sandi. Halaman yang besar atau kompleks dapat memerlukan lebih banyak memori atau mencapai batas pemrosesan bahkan ketika file berada dalam batas ini.
Pemrosesan menggunakan server kami. File sumber, file sementara, dan hasil akan dihapus dari server kami dalam waktu 30 menit setelah pemrosesan selesai. Kami tidak membagikan konten dokumen kepada pihak ketiga atau menggunakannya untuk melatih model AI.
Ketahui apa yang diharapkan sebelum Anda mulai.
Pemrosesan server sementaraAlat ini mengekspor konten dan geometri halaman, bukan bidang bisnis yang diberi nama secara otomatis. Aplikasi Anda harus menafsirkan struktur tersebut. Untuk sel tabel, gunakan Ekstrak Tabel dari PDF; untuk hasil pindai, gunakan OCR PDF.
Struktur versi mencakup halaman, blok teks dan rentang, font, kotak pembatas, dan jalur gambar vektor. Koordinat berada dalam titik PDF dari asal kiri atas halaman yang tidak diputar; rotasi dicatat secara terpisah. Ini dapat mendukung pengindeksan atau analisis dokumen, tetapi konverter tidak menyimpulkan skema bisnis atau nama bidang semantik Anda sendiri.
Ketika sebuah halaman berisi data gambar, arsip berisi document.json atau document.xml ditambah file gambar yang direferensikan dan masker apa pun yang didukung. Simpan jalur tersebut bersama-sama saat memuat data di tempat lain. Hasil pindai yang hanya berupa gambar tetap menjadi data gambar; ekspor ini tidak melakukan OCR untuk menciptakan rentang teks yang hilang.
Ekstraksi menggunakan lapisan teks yang sudah ada dan tidak mengenali huruf dalam gambar halaman. Jika halaman tidak memiliki teks yang dapat dibaca, gunakan PDF OCR secara terpisah. Halaman kosong juga dapat menghasilkan teks kosong. Untuk PDF campuran, periksa halaman kosong atau yang tidak dapat dibaca satu per satu. OCR memproses satu halaman yang dipilih dalam satu waktu.
Buka satu PDF hingga 100 MB dan 750 halaman sumber. File yang dilindungi memerlukan salinan yang tidak terkunci kecuali alat ini secara eksplisit menawarkan entri kata sandi. Halaman yang besar atau kompleks dapat memerlukan lebih banyak memori atau mencapai batas pemrosesan bahkan ketika file berada dalam batas ini.
Alat ini menggunakan server kami untuk pemrosesan. File asli Anda tidak ditimpa; hasilnya adalah unduhan terpisah. Pratinjau dan tinjau hasilnya jika tersedia, dan unduh salinan yang Anda butuhkan sebelum memulai kembali.
TUTORIAL VIDEO SINGKAT
Cara mengonversi PDF ke XML dengan data tata letak
Dapatkan data halaman terstruktur untuk alur kerja Anda sendiri.
Narasi bahasa Inggris
Tonton videonya