打开 PDF 转 XML 以导出页面记录、文本块和绘图数据。我们的四页 PDF 生成 document.xml 以及 ZIP 包内的一个引用 PNG 图像。
01
选择 PDF 页面
加载 PDF,将 页面 留空以处理整个文档,或输入您需要的子集。我们的示例包含所有四页。
02
导出并保持资源在一起
选择 开始。包含图像资源的导出将以 ZIP 格式下载。解压整个归档文件,并将 images 目录保留在 document.xml 旁边。
示例包含 images/page-001-image-005.png。图像引用指向资源路径,而不是将二进制数据嵌入 XML 中。不含图像资源的导出可直接下载为 .xml 文件。
03
读取文档结构
示例声明了版本 1、单位 pt 和 左上角 原点。页面记录包括源页码、尺寸、旋转、文本块和绘图。坐标描述的是未旋转的页面;在叠加数据时请考虑旋转因素。
使用 XML 解析器解析 XML。重复值使用 item 元素;一些几何元组为文本值。请检查实际结构,而不是假设使用 DocBook 等发布架构。
在您的处理工作流程中使用数据之前,请对照原始 PDF 检查阅读顺序和图像引用。
常见问题
XML 是否包含语义章节?
它描述了提取的页面数据。标题含义、阅读顺序和文档语义可能需要您自行解读。
为什么我收到了一个 ZIP 文件?
示例包含一张图像。ZIP 将 document.xml 和引用的资源保存在一起,以便能够定位图像。
轮到您了
打开 PDF 转 XML 用您的文档试一试
查看结果,然后保存您需要的版本。

