Alat150

Tugas PDF yang bermanfaat, dibuat sederhana

PDF ke XML.

Ekspor teks, gambar, dan geometri gambar PDF sebagai XML.

Advertisements
Ruang kerja PDF Anda
Pemrosesan server sementara
atau jatuhkan file Anda di sini
Dikirim untuk pemrosesan sementara saat Anda memulai. PDF
Advertisements

Cara mengubah pdf ke xml

  1. 01

    Pilih dokumen Anda

    Unggah satu PDF dari perangkat Anda.

  2. 02

    Atur hasil

    Tinjau pengaturan yang tersedia, lalu mulai pemrosesan.

  3. 03

    Unduh file Anda

    Simpan hasil dan periksa sebelum membagikannya.

BlogCara mengonversi PDF ke XML dengan data tata letakBaca panduan

PDF ke XML

Ekspor teks, gambar, dan geometri gambar PDF sebagai XML. Pilih halaman dan unduh deskripsi terstruktur, dengan aset gambar yang dikemas bersamanya saat diperlukan.

Jaga agar struktur sumber tetap terlihat
TUTORIAL VIDEO SINGKAT Cara mengonversi PDF ke XML dengan data tata letak Dapatkan data halaman terstruktur untuk alur kerja Anda sendiri. Narasi bahasa Inggris Tonton videonya

Cara mengonversi PDF ke XML dengan data tata letak

Cara praktis menggunakan alat ini

Pengembang

Masukkan ke alur kerja pemrosesan XML

Ekspor konten halaman sebagai XML untuk skrip atau aplikasi yang memahami struktur output yang didokumentasikan.

Peneliti

Periksa posisi teks

Gunakan koordinat konten untuk mempelajari tata letak halaman; koordinat tersebut merujuk pada halaman PDF yang tidak diputar, bukan piksel browser.

Tinjauan teknis

Pisahkan ekstraksi dari interpretasi

Tinjau objek yang diekstraksi sebelum membuat aturan penguraian khusus dokumen. Pemindaian memerlukan OCR untuk teks yang dikenali.

Fitur dan kontrol

Ekspor teks dan geometri gambar

Dapatkan deskripsi terstruktur dari konten halaman alih-alih transkrip biasa.

Skema, koordinat, dan rotasi halaman

Struktur berversi mencakup halaman, blok teks dan rentang, font, kotak pembatas, dan jalur gambar vektor. Koordinat berada dalam poin PDF dari asal kiri atas halaman yang tidak diputar; rotasi dicatat secara terpisah. Ini dapat mendukung pengindeksan atau analisis dokumen, tetapi konverter tidak menyimpulkan skema bisnis atau nama bidang semantik Anda sendiri.

Simpan aset gambar di samping data

Terima file data langsung atau ZIP saat gambar yang diekstrak disertakan.

File data dan gambar yang direferensikan

Saat halaman berisi data gambar, arsip berisi document.json atau document.xml ditambah file gambar yang direferensikan dan masker apa pun yang didukung. Simpan jalur tersebut bersama-sama saat memuat data di tempat lain. Pemindaian khusus gambar tetap berupa data gambar; ekspor ini tidak melakukan OCR untuk membuat rentang teks yang hilang.

Pilih halaman yang Anda perlukan

Proses seluruh dokumen atau masukkan nomor halaman dan rentang tertentu.

Rentang dan penomoran halaman

Gunakan posisi PDF, dimulai dari 1, alih-alih angka yang tercetak di halaman. Daftar seperti 1, 3-5 mencakup empat halaman. Rentang kosong menggunakan setiap halaman. Periksa pratinjau saat dokumen menyertakan sampul atau bab dengan penomoran berbeda. Hanya halaman yang dipilih yang disertakan dalam konversi ini.

Gunakan OCR untuk halaman yang hanya berisi gambar

Ekstraksi teks membaca lapisan teks; ini tidak mengenali huruf dalam gambar.

Pemindaian, halaman kosong, dan OCR

Ekstraksi menggunakan lapisan teks yang ada dan tidak mengenali huruf dalam gambar halaman. Jika halaman tidak memiliki teks yang dapat dibaca, gunakan PDF OCR secara terpisah. Halaman kosong juga dapat menghasilkan teks kosong. Untuk PDF campuran, periksa halaman kosong atau tidak terbaca secara individual. OCR memproses satu halaman yang dipilih sekaligus.

File & pemrosesan yang didukung

Input
PDF
Output
XML, ZIP

Buka satu PDF hingga 100 MB dan 750 halaman sumber. File yang dilindungi memerlukan salinan yang tidak terkunci kecuali alat ini secara eksplisit menawarkan entri kata sandi. Halaman yang besar atau kompleks dapat memerlukan lebih banyak memori atau mencapai batas pemrosesan bahkan ketika file berada dalam batas ini.

Pemrosesan menggunakan server kami. File sumber, file sementara, dan hasil akan dihapus dari server kami dalam waktu 30 menit setelah pemrosesan selesai. Kami tidak membagikan konten dokumen kepada pihak ketiga atau menggunakannya untuk melatih model AI.

Advertisements
FAQ

Beberapa jawaban yang berguna

Ketahui apa yang diharapkan sebelum Anda mulai.

Pemrosesan server sementara
Apakah PDF ke XML mengenali bidang faktur atau arti tabel?

Alat ini mengekspor konten dan geometri halaman, bukan bidang bisnis yang diberi nama secara otomatis. Aplikasi Anda harus menafsirkan struktur tersebut. Untuk sel tabel, gunakan Ekstrak Tabel dari PDF; untuk hasil pindai, gunakan OCR PDF.

Informasi apa yang terkandung dalam ekspor terstruktur?

Struktur versi mencakup halaman, blok teks dan rentang, font, kotak pembatas, dan jalur gambar vektor. Koordinat berada dalam titik PDF dari asal kiri atas halaman yang tidak diputar; rotasi dicatat secara terpisah. Ini dapat mendukung pengindeksan atau analisis dokumen, tetapi konverter tidak menyimpulkan skema bisnis atau nama bidang semantik Anda sendiri.

Mengapa unduhan terkadang berisi ZIP?

Ketika sebuah halaman berisi data gambar, arsip berisi document.json atau document.xml ditambah file gambar yang direferensikan dan masker apa pun yang didukung. Simpan jalur tersebut bersama-sama saat memuat data di tempat lain. Hasil pindai yang hanya berupa gambar tetap menjadi data gambar; ekspor ini tidak melakukan OCR untuk menciptakan rentang teks yang hilang.

Apakah ini akan mengekstrak kata dari hasil pindai yang hanya berupa gambar?

Ekstraksi menggunakan lapisan teks yang sudah ada dan tidak mengenali huruf dalam gambar halaman. Jika halaman tidak memiliki teks yang dapat dibaca, gunakan PDF OCR secara terpisah. Halaman kosong juga dapat menghasilkan teks kosong. Untuk PDF campuran, periksa halaman kosong atau yang tidak dapat dibaca satu per satu. OCR memproses satu halaman yang dipilih dalam satu waktu.

Berapa batas file dan halaman?

Buka satu PDF hingga 100 MB dan 750 halaman sumber. File yang dilindungi memerlukan salinan yang tidak terkunci kecuali alat ini secara eksplisit menawarkan entri kata sandi. Halaman yang besar atau kompleks dapat memerlukan lebih banyak memori atau mencapai batas pemrosesan bahkan ketika file berada dalam batas ini.

Di mana dokumen saya diproses?

Alat ini menggunakan server kami untuk pemrosesan. File asli Anda tidak ditimpa; hasilnya adalah unduhan terpisah. Pratinjau dan tinjau hasilnya jika tersedia, dan unduh salinan yang Anda butuhkan sebelum memulai kembali.

Lanjutkan

Apa yang ingin Anda lakukan selanjutnya?

Pilih alat. PDF yang sudah selesai akan ikut dengan Anda.

PDF

Advertisements

Bahasa38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina