Instrumente150

O sarcină PDF utilă, simplificată

PDF în XML.

Exportă textul, imaginile și geometria desenelor din PDF ca XML.

Advertisements
Spațiul dvs. de lucru PDF
Procesare temporară pe server
sau plasați fișierele aici
Trimis pentru procesare temporară când începeți. PDF
Advertisements

Cum se convertește PDF în XML

  1. 01

    Alegeți documentul

    Încărcați un PDF de pe dispozitivul dvs.

  2. 02

    Configurați rezultatul

    Examinați setările disponibile, apoi începeți procesarea.

  3. 03

    Descărcați fișierul

    Salvați rezultatul și verificați-l înainte de a-l partaja.

BlogCum să convertești PDF în XML cu date de layoutCitește ghidul

PDF în XML

Exportați textul, imaginile și geometria desenului din PDF ca XML. Selectați paginile și descărcați o descriere structurată, cu activele de imagine împachetate alături de aceasta atunci când este necesar.

Păstrați structura sursei vizibilă
TUTORIAL VIDEO RAPID Cum să convertești PDF în XML cu date de layout Obține date structurate despre pagină pentru fluxul tău de lucru. Narațiune în engleză Urmărește videoclipul

Cum să convertești PDF în XML cu date de layout

Modalități practice de utilizare a acestui instrument

Dezvoltatori

Alimentați un flux de lucru de procesare XML

Exportați conținutul paginii ca XML pentru un script sau o aplicație care înțelege structura de ieșire documentată.

Cercetători

Inspectați pozițiile textului

Utilizați coordonatele conținutului pentru a studia aspectul paginii; acestea se referă la pagina PDF nerotită, mai degrabă decât la pixelii browserului.

Revizuire tehnică

Separați extracția de interpretare

Examinați obiectele extrase înainte de a construi reguli de parsare specifice documentului. Scanările necesită OCR pentru textul recunoscut.

Funcționalități și controale

Exportă textul și geometria desenelor

Obține o descriere structurată a conținutului paginii în loc de o transcriere simplă.

Schemă, coordonate și rotirea paginii

Structura versionată include pagini, blocuri de text și segmente, fonturi, casete de încadrare și căi de desenare vectorială. Coordonatele sunt exprimate în puncte PDF de la originea din stânga-sus a paginii nerotite; rotirea este înregistrată separat. Acest lucru poate sprijini indexarea sau analiza documentelor, dar convertorul nu deduce propria ta schemă de afaceri sau numele câmpurilor semantice.

Păstrează activele de imagine lângă date

Primește un fișier de date direct sau un ZIP atunci când sunt incluse imagini extrase.

Fișier de date și imagini referențiate

Atunci când o pagină conține date de imagine, arhiva conține document.json sau document.xml plus fișierele de imagine referențiate și orice măști acceptate. Păstrează acele căi împreună atunci când încarci datele în altă parte. O scanare care conține doar imagini rămâne o dată de tip imagine; acest export nu efectuează OCR pentru a inventa segmente de text lipsă.

Alegeți paginile de care aveți nevoie

Procesați întregul document sau introduceți numere de pagină și intervale specifice.

Intervale de pagini și numerotare

Utilizați pozițiile PDF, începând cu 1, mai degrabă decât numerele imprimate pe pagină. O listă precum 1, 3-5 include patru pagini. Un interval gol utilizează fiecare pagină. Verificați previzualizarea când documentul include o copertă sau capitole numerotate diferit. Doar paginile alese sunt incluse în această conversie.

Folosește OCR pentru paginile care conțin doar imagini

Extracția textului citește un strat de text; aceasta nu recunoaște literele din imagini.

Scanări, pagini goale și OCR

Extracția utilizează un strat de text existent și nu recunoaște literele din imaginile paginilor. Dacă o pagină nu are text lizibil, folosește PDF OCR separat. O pagină goală poate, de asemenea, să nu producă niciun text. Pentru PDF-uri mixte, inspectează individual paginile goale sau ilizibile. OCR procesează câte o pagină selectată pe rând.

Fișiere și procesare acceptate

Intrare
PDF
Ieșire
XML, ZIP

Deschideți un PDF de până la 100 MB și 750 pagini sursă. Fișierele protejate au nevoie de o copie deblocată, cu excepția cazului în care acest instrument oferă explicit introducerea parolei. Paginile mari sau complexe pot necesita mai multă memorie sau pot atinge limitele de procesare chiar și atunci când fișierul se încadrează în aceste limite.

Procesarea utilizează serverele noastre. Fișierele sursă, fișierele temporare și rezultatele sunt șterse de pe serverele noastre în termen de 30 de minute după finalizarea procesării. Nu partajăm conținutul documentelor cu terțe părți și nu îl folosim pentru a antrena modele AI.

Advertisements
Întrebări frecvente

Câteva răspunsuri utile

Știți la ce să vă așteptați înainte de a începe.

Procesare temporară pe server
PDF în XML recunoaște câmpurile facturilor sau semnificațiile tabelelor?

Acesta exportă conținutul și geometria paginii, nu câmpuri de afaceri denumite automat. Aplicația dumneavoastră trebuie să interpreteze acea structură. Pentru celule de tabel, utilizați Extragere tabele din PDF; pentru scanări, utilizați OCR PDF.

Ce informații conține exportul structurat?

Structura versionată include pagini, blocuri de text și intervale, fonturi, casete de delimitare și căi de desenare vectorială. Coordonatele sunt în puncte PDF de la originea din stânga sus a paginii nerotite; rotația este înregistrată separat. Acest lucru poate susține indexarea sau analiza documentelor, dar convertorul nu deduce propria dumneavoastră schemă de afaceri sau nume de câmpuri semantice.

De ce descărcarea conține uneori o arhivă ZIP?

Când o pagină conține date de imagine, arhiva conține document.json sau document.xml plus fișierele imagine referențiate și orice măști acceptate. Păstrați acele căi împreună atunci când încărcați datele în altă parte. O scanare care conține doar imagini rămâne date de imagine; acest export nu efectuează OCR pentru a inventa intervale de text lipsă.

Acest instrument va extrage cuvinte dintr-o scanare care conține doar imagini?

Extracția utilizează un strat de text existent și nu recunoaște literele din imaginile paginilor. Dacă o pagină nu are text lizibil, utilizați PDF OCR separat. O pagină goală poate, de asemenea, să nu producă niciun text. Pentru PDF-urile mixte, inspectați paginile goale sau ilizibile individual. OCR procesează câte o pagină selectată pe rând.

Care sunt limitele de fișiere și pagini?

Deschideți un PDF de până la 100 MB și 750 pagini sursă. Fișierele protejate au nevoie de o copie deblocată, cu excepția cazului în care acest instrument oferă explicit introducerea parolei. Paginile mari sau complexe pot necesita mai multă memorie sau pot atinge limitele de procesare chiar și atunci când fișierul se încadrează în aceste limite.

Unde este procesat documentul meu?

Acest instrument utilizează serverele noastre pentru procesare. Fișierul original nu este suprascris; rezultatul este o descărcare separată. Previzualizați și verificați rezultatul acolo unde este disponibil și descărcați copia de care aveți nevoie înainte de a începe din nou.

Continuă

Ce ai dori să faci în continuare?

Alege un instrument. PDF-ul tău finalizat te însoțește.

PDF

Advertisements

Limba38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina