打开 从PDF中提取数据,无需逐行复制即可从一个 PDF 中收集值。此对比使用了真实的示例文件和从工具下载的 CSV。在选中电子邮件、电话、网址、DOI、ISBN 和 IPv4 的情况下,三页的示例产生了 15 个匹配项中的 11 个唯一行。
打开您的 PDF
上传一个 PDF,或选择 尝试示例以跟随此示例操作。PDF 预览和页面缩略图将会显示。您的原始文件保持不变,提取过程在您的浏览器中运行。
基于文本的目录、报告、研究论文或宣传册是一个有用的起点。纯图像扫描件在识别打印文本前需要进行 OCR。
选择有用的选项
在手机上,打开 设置。在桌面上,使用预览旁边的设置面板。
在 提取内容下,电子邮件、电话号码和网址默认处于选中状态。打开 更多数据类型并同时选中 DOI、ISBN 和 IPv4 地址。保持删除重复项功能开启并选择 CSV。
提取并检查匹配项
选择 提取。处理完成后,结果选项卡将显示值、出现次数和源页面。选择一个圆形的页码以在 PDF 预览中查看其位置,然后返回结果页面。
输出结果结合了联系人列表以及来自第 2 页的 DOI 10.1000/182、ISBN 978-0-306-40615-7 和 IPv4 地址 192.0.2.10。类型列标识了每个值。在复制或下载较小的子集之前,筛选出相关的词或标识符。
使用 筛选结果来缩小列表范围。复制和下载操作包含所有匹配行,即使结果表格跨越了多个屏幕的行数。
下载 CSV 或 TXT
选择 下载 CSV,然后使用就绪屏幕上的主 下载按钮。CSV 包含类型、值、计数和页码列。TXT 和 全部复制每行包含一个值。
可能被解释为电子表格公式的 CSV 值会以单引号开头进行保护。例如,国际电话号码以加号开头。如果您需要没有电子表格保护的纯列表,请使用 TXT。
常见问题
这会提取任何数字或每个标识符吗?
不是。每个选定的类别都有其自己的识别规则。IPv6、百分比、价格和支付卡号不会被提取。请根据源文件核对匹配项;有效的格式无法确认联系人或标识符确实存在。
我应该如何处理扫描的 PDF?
先运行 PDF OCR,然后将识别后的副本加载到此工具中。请仔细检查 OCR 输出:错误的字符可能会更改地址或标识符。
提取限制是什么?
每个 PDF 最多支持 50 MiB 和 750 页。提取总数限制为 20,000 个匹配项,每页限制为 2,000 个,处理预算为 90 秒。文本和注释限制同样适用。如果限制或无法读取的页面中断了扫描,工具会显示部分结果通知,并将导出文件名标记为部分。
我的 PDF 链接会自动打开吗?
不是。提取过程在浏览器中读取文件,不会访问提取出的目标链接。页面按钮用于在 PDF 预览内导航。
保留值及其上下文
提取重点列表,检查源页面,并下载适合您下一步操作的格式。

