Odprite PDF v XML za izvoz zapisov strani, besedilnih blokov in podatkov o risanju. Naš štiristranski PDF ustvari document.xml in eno referenčno sliko PNG znotraj datoteke ZIP.
Izberite strani PDF
Naložite PDF in pustite Strani prazne za celoten dokument ali vnesite podmnožico, ki jo potrebujete. Naš primer vključuje vse štiri strani.
Izvozite in ohranite datoteke skupaj
Izberite Začni. Izvoz s slikovnimi datotekami se prenese kot ZIP. Izvlecite celoten arhiv in ohranite imenik images poleg document.xml.
Vzorec vključuje images/page-001-image-005.png. Slikovne reference kažejo na poti do datotek namesto vdelave binarnih podatkov v XML. Izvoz brez slikovnih datotek se lahko prenese neposredno kot .xml.
Preberite strukturo dokumenta
Vzorec deklarira različico 1, enote pt in izhodišče zgoraj-levo. Zapisi strani vključujejo številko izvorne strani, dimenzije, rotacijo, bloke in risbe. Koordinate opisujejo nerotirano stran; pri prekrivanju podatkov upoštevajte rotacijo.
Razčlenite XML s razčlenjevalnikom XML. Ponavljajoče se vrednosti uporabljajo elemente item; nekatere geometrijske n-terice so besedilne vrednosti. Preglejte dejansko strukturo namesto predvidevanja sheme objavljanja, kot je DocBook.
Pred uporabo podatkov v svojem poteku dela preverite vrstni red branja in slikovne reference glede na izvirni PDF.
Pogosta vprašanja
Ali XML vsebuje semantična poglavja?
Opisuje ekstrahirane podatke strani. Pomen naslovov, vrstni red branja in semantika dokumenta morda potrebujejo vašo lastno interpretacijo.
Zakaj sem prejel ZIP?
Vzorec vsebuje sliko. ZIP ohranja document.xml in referenčno datoteko skupaj, tako da je sliko mogoče najti.
Poskusite s svojim dokumentom
Preglejte rezultat in nato shranite različico, ki jo potrebujete.

