Apri PDF to XML per esportare record di pagina, blocchi di testo e dati di disegno. Il nostro PDF di quattro pagine produce document.xml più un'immagine PNG referenziata all'interno di un file ZIP.
Scegli le pagine PDF
Carica il PDF e lascia Pages vuoto per l'intero documento, oppure inserisci il sottoinsieme di cui hai bisogno. Il nostro esempio include tutte e quattro le pagine.
Esporta e mantieni gli asset insieme
Scegli Start. Un'esportazione con asset immagine viene scaricata come ZIP. Estrai l'intero archivio e mantieni la directory images accanto a document.xml.
Il campione include images/page-001-image-005.png. I riferimenti alle immagini puntano ai percorsi degli asset invece di incorporare dati binari nell'XML. Un'esportazione senza asset immagine può essere scaricata direttamente come .xml.
Leggi la struttura del documento
Il campione dichiara la versione 1, le unità pt e un'origine top-left. I record di pagina includono numero di pagina sorgente, dimensioni, rotazione, blocchi e disegni. Le coordinate descrivono la pagina non ruotata; tieni conto della rotazione quando sovrapponi i dati.
Analizza l'XML con un parser XML. I valori ripetuti utilizzano elementi item; alcune tuple geometriche sono valori testuali. Ispeziona la struttura effettiva invece di presumere uno schema di pubblicazione come DocBook.
Controlla l'ordine di lettura e i riferimenti alle immagini rispetto al PDF originale prima di utilizzare i dati nel tuo flusso di lavoro di elaborazione.
Domande comuni
L'XML contiene capitoli semantici?
Descrive i dati di pagina estratti. Il significato delle intestazioni, l'ordine di lettura e la semantica del documento potrebbero richiedere una tua interpretazione.
Perché ho ricevuto uno ZIP?
Il campione contiene un'immagine. Lo ZIP mantiene document.xml e l'asset referenziato insieme in modo che l'immagine possa essere localizzata.
Provalo con il tuo documento
Rivedi il risultato, quindi salva la versione di cui hai bisogno.

