Outils150

UN GUIDE PRATIQUE DU PDF

Comment convertir un PDF en XML avec les données de mise en page

Obtenez des données de page structurées pour votre propre flux de travail.

Exportez le texte, les dimensions des pages et les données de dessin d'un PDF au format XML. Gardez les images référencées ensemble et inspectez la structure avant de l'utiliser dans votre code.

Suivre le guide
UN EXEMPLE D'OUTIL RÉEL
AvantPremière page de la source PDF de quatre pages.
  • 4 pages PDF
AprèsExtrait d'ouverture mis en forme de l'exportation document.xml réelle.
  • document.xml · 4 enregistrements de page
  • 1 ressource PNG référencée
Le résultat est une donnée XML structurée, présentée ici sous forme d'extrait. L'exportation complète inclut les quatre pages et l'image référencée.
Advertisements
TUTORIEL VIDÉO RAPIDE Comment convertir un PDF en XML avec les données de mise en page Obtenez des données de page structurées pour votre propre flux de travail. Narration en anglais Regarder la vidéo

Comment convertir un PDF en XML avec les données de mise en page

Advertisements

Ouvrez PDF vers XML pour exporter les enregistrements de page, les blocs de texte et les données de dessin. Notre PDF de quatre pages produit document.xml ainsi qu'une image PNG référencée dans un fichier ZIP.

01

Choisissez les pages PDF

Chargez le PDF et laissez Pages vide pour traiter tout le document, ou saisissez le sous-ensemble dont vous avez besoin. Notre exemple inclut les quatre pages.

02

Exporter et garder les ressources ensemble

Choisissez Démarrer. Une exportation avec des ressources d'image est téléchargée sous forme de fichier ZIP. Extrayez l'archive complète et conservez le répertoire images à côté de document.xml.

L'exemple inclut images/page-001-image-005.png. Les références d'image pointent vers les chemins d'accès aux ressources au lieu d'intégrer des données binaires dans le XML. Une exportation sans ressources d'image peut être téléchargée directement au format .xml.

03

Lire la structure du document

L'exemple déclare la version 1, les unités pt et une origine en haut à gauche. Les enregistrements de page incluent le numéro de page source, les dimensions, la rotation, les blocs et les dessins. Les coordonnées décrivent la page non pivotée ; tenez compte de la rotation lors de la superposition des données.

Analysez le XML avec un parseur XML. Les valeurs répétées utilisent des éléments d'article ; certains tuples géométriques sont des valeurs textuelles. Inspectez la structure réelle au lieu de supposer un schéma de publication tel que DocBook.

Vérifiez l'ordre de lecture et les références d'image par rapport au PDF original avant d'utiliser les données dans votre flux de travail.

QUELQUES DÉTAILS UTILES

Questions fréquentes

Le XML contient-il des chapitres sémantiques ?

Cela décrit les données de page extraites. La signification des titres, l'ordre de lecture et la sémantique du document peuvent nécessiter votre propre interprétation.

Pourquoi ai-je reçu un fichier ZIP ?

L'exemple contient une image. Le fichier ZIP maintient document.xml et la ressource référencée ensemble afin que l'image puisse être localisée.

À VOUS DE JOUER

Essayez avec votre document

Examinez le résultat, puis enregistrez la version dont vous avez besoin.

Ouvrir PDF vers XML

Détail de l'image

Advertisements

Langue38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina