Strumenti150

UNA GUIDA PRATICA AL PDF

Come convertire PDF in XML con dati di layout

Ottieni dati di pagina strutturati per il tuo flusso di lavoro.

Esporta testo, dimensioni pagina e dati di disegno del PDF in formato XML. Mantieni unite le immagini referenziate e ispeziona la struttura prima di utilizzarla nel codice.

Segui la guida
UN ESEMPIO DI STRUMENTO REALE
PrimaPrima pagina del PDF sorgente di quattro pagine.
  • 4 pagine PDF
DopoEstratto iniziale formattato dell'esportazione document.xml effettiva.
  • document.xml · 4 record di pagina
  • 1 asset PNG referenziato
Il risultato è costituito da dati XML strutturati, mostrati come estratto. L'esportazione completa include tutte e quattro le pagine e l'asset immagine referenziato.
Advertisements
VIDEO TUTORIAL RAPIDO Come convertire PDF in XML con dati di layout Ottieni dati di pagina strutturati per il tuo flusso di lavoro. Narrazione in inglese Guarda il video

Come convertire PDF in XML con dati di layout

Advertisements

Apri PDF to XML per esportare record di pagina, blocchi di testo e dati di disegno. Il nostro PDF di quattro pagine produce document.xml più un'immagine PNG referenziata all'interno di un file ZIP.

01

Scegli le pagine PDF

Carica il PDF e lascia Pages vuoto per l'intero documento, oppure inserisci il sottoinsieme di cui hai bisogno. Il nostro esempio include tutte e quattro le pagine.

02

Esporta e mantieni gli asset insieme

Scegli Start. Un'esportazione con asset immagine viene scaricata come ZIP. Estrai l'intero archivio e mantieni la directory images accanto a document.xml.

Il campione include images/page-001-image-005.png. I riferimenti alle immagini puntano ai percorsi degli asset invece di incorporare dati binari nell'XML. Un'esportazione senza asset immagine può essere scaricata direttamente come .xml.

03

Leggi la struttura del documento

Il campione dichiara la versione 1, le unità pt e un'origine top-left. I record di pagina includono numero di pagina sorgente, dimensioni, rotazione, blocchi e disegni. Le coordinate descrivono la pagina non ruotata; tieni conto della rotazione quando sovrapponi i dati.

Analizza l'XML con un parser XML. I valori ripetuti utilizzano elementi item; alcune tuple geometriche sono valori testuali. Ispeziona la struttura effettiva invece di presumere uno schema di pubblicazione come DocBook.

Controlla l'ordine di lettura e i riferimenti alle immagini rispetto al PDF originale prima di utilizzare i dati nel tuo flusso di lavoro di elaborazione.

QUALCHE DETTAGLIO UTILE

Domande comuni

L'XML contiene capitoli semantici?

Descrive i dati di pagina estratti. Il significato delle intestazioni, l'ordine di lettura e la semantica del documento potrebbero richiedere una tua interpretazione.

Perché ho ricevuto uno ZIP?

Il campione contiene un'immagine. Lo ZIP mantiene document.xml e l'asset referenziato insieme in modo che l'immagine possa essere localizzata.

TOCCA A TE

Provalo con il tuo documento

Rivedi il risultato, quindi salva la versione di cui hai bisogno.

Apri PDF to XML

Dettaglio immagine

Advertisements

Lingua38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina