Alimentați un flux de lucru de procesare XML
Exportați conținutul paginii ca XML pentru un script sau o aplicație care înțelege structura de ieșire documentată.
Exportă textul, imaginile și geometria desenelor din PDF ca XML.
Folosiți controalele paginii pentru a vă inspecta documentul.
Descarcă rezultatul sau revino la setări pentru a face o altă versiune.
Încărcați un PDF de pe dispozitivul dvs.
Examinați setările disponibile, apoi începeți procesarea.
Salvați rezultatul și verificați-l înainte de a-l partaja.
Exportați textul, imaginile și geometria desenului din PDF ca XML. Selectați paginile și descărcați o descriere structurată, cu activele de imagine împachetate alături de aceasta atunci când este necesar.
Exportați conținutul paginii ca XML pentru un script sau o aplicație care înțelege structura de ieșire documentată.
Utilizați coordonatele conținutului pentru a studia aspectul paginii; acestea se referă la pagina PDF nerotită, mai degrabă decât la pixelii browserului.
Examinați obiectele extrase înainte de a construi reguli de parsare specifice documentului. Scanările necesită OCR pentru textul recunoscut.
Obține o descriere structurată a conținutului paginii în loc de o transcriere simplă.
Structura versionată include pagini, blocuri de text și segmente, fonturi, casete de încadrare și căi de desenare vectorială. Coordonatele sunt exprimate în puncte PDF de la originea din stânga-sus a paginii nerotite; rotirea este înregistrată separat. Acest lucru poate sprijini indexarea sau analiza documentelor, dar convertorul nu deduce propria ta schemă de afaceri sau numele câmpurilor semantice.
Primește un fișier de date direct sau un ZIP atunci când sunt incluse imagini extrase.
Atunci când o pagină conține date de imagine, arhiva conține document.json sau document.xml plus fișierele de imagine referențiate și orice măști acceptate. Păstrează acele căi împreună atunci când încarci datele în altă parte. O scanare care conține doar imagini rămâne o dată de tip imagine; acest export nu efectuează OCR pentru a inventa segmente de text lipsă.
Procesați întregul document sau introduceți numere de pagină și intervale specifice.
Utilizați pozițiile PDF, începând cu 1, mai degrabă decât numerele imprimate pe pagină. O listă precum 1, 3-5 include patru pagini. Un interval gol utilizează fiecare pagină. Verificați previzualizarea când documentul include o copertă sau capitole numerotate diferit. Doar paginile alese sunt incluse în această conversie.
Extracția textului citește un strat de text; aceasta nu recunoaște literele din imagini.
Extracția utilizează un strat de text existent și nu recunoaște literele din imaginile paginilor. Dacă o pagină nu are text lizibil, folosește PDF OCR separat. O pagină goală poate, de asemenea, să nu producă niciun text. Pentru PDF-uri mixte, inspectează individual paginile goale sau ilizibile. OCR procesează câte o pagină selectată pe rând.
Deschideți un PDF de până la 100 MB și 750 pagini sursă. Fișierele protejate au nevoie de o copie deblocată, cu excepția cazului în care acest instrument oferă explicit introducerea parolei. Paginile mari sau complexe pot necesita mai multă memorie sau pot atinge limitele de procesare chiar și atunci când fișierul se încadrează în aceste limite.
Procesarea utilizează serverele noastre. Fișierele sursă, fișierele temporare și rezultatele sunt șterse de pe serverele noastre în termen de 30 de minute după finalizarea procesării. Nu partajăm conținutul documentelor cu terțe părți și nu îl folosim pentru a antrena modele AI.
Știți la ce să vă așteptați înainte de a începe.
Procesare temporară pe serverAcesta exportă conținutul și geometria paginii, nu câmpuri de afaceri denumite automat. Aplicația dumneavoastră trebuie să interpreteze acea structură. Pentru celule de tabel, utilizați Extragere tabele din PDF; pentru scanări, utilizați OCR PDF.
Structura versionată include pagini, blocuri de text și intervale, fonturi, casete de delimitare și căi de desenare vectorială. Coordonatele sunt în puncte PDF de la originea din stânga sus a paginii nerotite; rotația este înregistrată separat. Acest lucru poate susține indexarea sau analiza documentelor, dar convertorul nu deduce propria dumneavoastră schemă de afaceri sau nume de câmpuri semantice.
Când o pagină conține date de imagine, arhiva conține document.json sau document.xml plus fișierele imagine referențiate și orice măști acceptate. Păstrați acele căi împreună atunci când încărcați datele în altă parte. O scanare care conține doar imagini rămâne date de imagine; acest export nu efectuează OCR pentru a inventa intervale de text lipsă.
Extracția utilizează un strat de text existent și nu recunoaște literele din imaginile paginilor. Dacă o pagină nu are text lizibil, utilizați PDF OCR separat. O pagină goală poate, de asemenea, să nu producă niciun text. Pentru PDF-urile mixte, inspectați paginile goale sau ilizibile individual. OCR procesează câte o pagină selectată pe rând.
Deschideți un PDF de până la 100 MB și 750 pagini sursă. Fișierele protejate au nevoie de o copie deblocată, cu excepția cazului în care acest instrument oferă explicit introducerea parolei. Paginile mari sau complexe pot necesita mai multă memorie sau pot atinge limitele de procesare chiar și atunci când fișierul se încadrează în aceste limite.
Acest instrument utilizează serverele noastre pentru procesare. Fișierul original nu este suprascris; rezultatul este o descărcare separată. Previzualizați și verificați rezultatul acolo unde este disponibil și descărcați copia de care aveți nevoie înainte de a începe din nou.
TUTORIAL VIDEO RAPID
Cum să convertești PDF în XML cu date de layout
Obține date structurate despre pagină pentru fluxul tău de lucru.
Narațiune în engleză
Urmărește videoclipul