Herramientas150

UNA GUÍA PRÁCTICA DE PDF

Cómo convertir PDF a XML con datos de diseño

Obtenga datos de página estructurados para su propio flujo de trabajo.

Exporte texto, dimensiones de página y datos de dibujo de PDF a XML. Mantenga las imágenes referenciadas juntas e inspeccione la estructura antes de usarla en su código.

Seguir la guía
UN EJEMPLO DE HERRAMIENTA REAL
AntesPrimera página de la fuente PDF de cuatro páginas.
  • 4 páginas PDF
DespuésExtracto inicial con formato legible de la exportación real document.xml.
  • document.xml · 4 registros de página
  • 1 recurso PNG referenciado
El resultado son datos XML estructurados, que se muestran como un extracto. La exportación completa incluye las cuatro páginas y el recurso de imagen referenciado.
Advertisements
VIDEO TUTORIAL RÁPIDO Cómo convertir PDF a XML con datos de diseño Obtenga datos de página estructurados para su propio flujo de trabajo. Narración en inglés Ver el video

Cómo convertir PDF a XML con datos de diseño

Advertisements

Abra PDF a XML para exportar registros de página, bloques de texto y datos de dibujo. Nuestro PDF de cuatro páginas genera document.xml además de una imagen PNG referenciada dentro de un archivo ZIP.

01

Elija las páginas del PDF

Cargue el PDF y deje Páginas en blanco para todo el documento, o introduzca el subconjunto que necesite. Nuestro ejemplo incluye las cuatro páginas.

02

Exporte y mantenga los recursos juntos

Elija Iniciar. Una exportación con recursos de imagen se descarga como ZIP. Extraiga todo el archivo y mantenga el directorio images junto a document.xml.

La muestra incluye images/page-001-image-005.png. Las referencias de imagen apuntan a rutas de recursos en lugar de incrustar datos binarios en el XML. Una exportación sin recursos de imagen puede descargarse directamente como .xml.

03

Lea la estructura del documento

La muestra declara la versión 1, unidades pt y un origen superior izquierdo. Los registros de página incluyen el número de página de origen, dimensiones, rotación, bloques y dibujos. Las coordenadas describen la página sin rotar; tenga en cuenta la rotación al superponer los datos.

Analice el XML con un analizador XML. Los valores repetidos utilizan elementos de ítem; algunas tuplas geométricas son valores de texto. Inspeccione la estructura real en lugar de asumir un esquema de publicación como DocBook.

Compruebe el orden de lectura y las referencias de imagen con respecto al PDF original antes de utilizar los datos en su flujo de trabajo de procesamiento.

ALGUNOS DETALLES ÚTILES

Preguntas frecuentes

¿Contiene el XML capítulos semánticos?

Describe los datos de página extraídos. El significado de los encabezados, el orden de lectura y la semántica del documento pueden requerir su propia interpretación.

¿Por qué recibí un archivo ZIP?

La muestra contiene una imagen. El archivo ZIP mantiene document.xml y el recurso referenciado juntos para que la imagen pueda ser localizada.

ES SU TURNO

Pruébelo con su documento

Revise el resultado y luego guarde la versión que necesite.

Abrir PDF a XML

Detalle de la imagen

Advertisements

Idioma38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina