Apri PDF to JSON per esportare record di pagina, blocchi di testo e dati di disegno. Il nostro PDF di quattro pagine produce document.json più un'immagine PNG referenziata all'interno di un file ZIP.
Scegli le pagine PDF
Carica il PDF e lascia Pages vuoto per l'intero documento, oppure inserisci il sottoinsieme di cui hai bisogno. Il nostro esempio include tutte e quattro le pagine.
Esporta e mantieni gli asset insieme
Scegli Start. Un'esportazione con asset immagine viene scaricata come ZIP. Estrai l'intero archivio e mantieni la directory images accanto a document.json.
Il campione include images/page-001-image-005.png. I riferimenti alle immagini puntano ai percorsi degli asset invece di incorporare dati binari nel JSON. Un'esportazione senza asset immagine può essere scaricata direttamente come .json.
Leggi la struttura del documento
Il campione dichiara la versione 1, le unità pt e un'origine top-left. I record di pagina includono numero di pagina sorgente, dimensioni, rotazione, blocchi e disegni. Le coordinate descrivono la pagina non ruotata; tieni conto della rotazione quando sovrapponi i dati.
Analizza il JSON con un parser JSON. Ispeziona blocchi, righe e intervalli per testo e stile, e i valori bbox per la geometria. Gli oggetti nidificati descrivono il layout piuttosto che una singola stringa di testo.
Controlla l'ordine di lettura e i riferimenti alle immagini rispetto al PDF originale prima di utilizzare i dati nel tuo flusso di lavoro di elaborazione.
Domande comuni
Posso ricostruire esattamente il PDF originale?
Non dare per scontata una ricostruzione esatta. L'esportazione descrive il contenuto e la geometria disponibili, mentre le caratteristiche e la semantica del PDF possono essere più complesse.
Perché ho ricevuto uno ZIP?
Il campione contiene un'immagine. Lo ZIP mantiene document.json e l'asset referenziato insieme in modo che l'immagine possa essere localizzata.
Provalo con il tuo documento
Rivedi il risultato, quindi salva la versione di cui hai bisogno.

