Abra PDF a XML para exportar registros de página, bloques de texto y datos de dibujo. Nuestro PDF de cuatro páginas genera document.xml además de una imagen PNG referenciada dentro de un archivo ZIP.
Elija las páginas del PDF
Cargue el PDF y deje Páginas en blanco para todo el documento, o introduzca el subconjunto que necesite. Nuestro ejemplo incluye las cuatro páginas.
Exporte y mantenga los recursos juntos
Elija Iniciar. Una exportación con recursos de imagen se descarga como ZIP. Extraiga todo el archivo y mantenga el directorio images junto a document.xml.
La muestra incluye images/page-001-image-005.png. Las referencias de imagen apuntan a rutas de recursos en lugar de incrustar datos binarios en el XML. Una exportación sin recursos de imagen puede descargarse directamente como .xml.
Lea la estructura del documento
La muestra declara la versión 1, unidades pt y un origen superior izquierdo. Los registros de página incluyen el número de página de origen, dimensiones, rotación, bloques y dibujos. Las coordenadas describen la página sin rotar; tenga en cuenta la rotación al superponer los datos.
Analice el XML con un analizador XML. Los valores repetidos utilizan elementos de ítem; algunas tuplas geométricas son valores de texto. Inspeccione la estructura real en lugar de asumir un esquema de publicación como DocBook.
Compruebe el orden de lectura y las referencias de imagen con respecto al PDF original antes de utilizar los datos en su flujo de trabajo de procesamiento.
Preguntas frecuentes
¿Contiene el XML capítulos semánticos?
Describe los datos de página extraídos. El significado de los encabezados, el orden de lectura y la semántica del documento pueden requerir su propia interpretación.
¿Por qué recibí un archivo ZIP?
La muestra contiene una imagen. El archivo ZIP mantiene document.xml y el recurso referenciado juntos para que la imagen pueda ser localizada.
Pruébelo con su documento
Revise el resultado y luego guarde la versión que necesite.

