工具150

实用的 PDF 指南

如何从 PDF 中提取结构化数据

将联系人和研究标识符收集到一个有组织的列表中。

在选中电子邮件、电话、网址、DOI、ISBN 和 IPv4 的情况下,三页示例从 15 次出现中生成了 11 个唯一行。

跟随指南操作
一个真实的工具示例
PDF 页面来自真实示例 PDF 的一页
提取的值来自实际 CSV 下载的值和页面引用
六种选定的数据类型在实际 CSV 中产生了 11 个唯一行,包括第 2 页上的 DOI、ISBN 和 IPv4 条目。
Advertisements
快速视频教程 如何从 PDF 中提取结构化数据 将联系人和研究标识符收集到一个有组织的列表中。 英语旁白 观看视频

如何从 PDF 中提取结构化数据

Advertisements

打开 从PDF中提取数据,无需逐行复制即可从一个 PDF 中收集值。此对比使用了真实的示例文件和从工具下载的 CSV。在选中电子邮件、电话、网址、DOI、ISBN 和 IPv4 的情况下,三页的示例产生了 15 个匹配项中的 11 个唯一行。

01

打开您的 PDF

上传一个 PDF,或选择 尝试示例以跟随此示例操作。PDF 预览和页面缩略图将会显示。您的原始文件保持不变,提取过程在您的浏览器中运行。

基于文本的目录、报告、研究论文或宣传册是一个有用的起点。纯图像扫描件在识别打印文本前需要进行 OCR。

02

选择有用的选项

在手机上,打开 设置。在桌面上,使用预览旁边的设置面板。

在 提取内容下,电子邮件、电话号码和网址默认处于选中状态。打开 更多数据类型并同时选中 DOI、ISBN 和 IPv4 地址。保持删除重复项功能开启并选择 CSV。

03

提取并检查匹配项

选择 提取。处理完成后,结果选项卡将显示值、出现次数和源页面。选择一个圆形的页码以在 PDF 预览中查看其位置,然后返回结果页面。

输出结果结合了联系人列表以及来自第 2 页的 DOI 10.1000/182、ISBN 978-0-306-40615-7 和 IPv4 地址 192.0.2.10。类型列标识了每个值。在复制或下载较小的子集之前,筛选出相关的词或标识符。

使用 筛选结果来缩小列表范围。复制和下载操作包含所有匹配行,即使结果表格跨越了多个屏幕的行数。

04

下载 CSV 或 TXT

选择 下载 CSV,然后使用就绪屏幕上的主 下载按钮。CSV 包含类型、值、计数和页码列。TXT 和 全部复制每行包含一个值。

可能被解释为电子表格公式的 CSV 值会以单引号开头进行保护。例如,国际电话号码以加号开头。如果您需要没有电子表格保护的纯列表,请使用 TXT。

一些有用的细节

常见问题

这会提取任何数字或每个标识符吗?

不是。每个选定的类别都有其自己的识别规则。IPv6、百分比、价格和支付卡号不会被提取。请根据源文件核对匹配项;有效的格式无法确认联系人或标识符确实存在。

我应该如何处理扫描的 PDF?

先运行 PDF OCR,然后将识别后的副本加载到此工具中。请仔细检查 OCR 输出:错误的字符可能会更改地址或标识符。

提取限制是什么?

每个 PDF 最多支持 50 MiB 和 750 页。提取总数限制为 20,000 个匹配项,每页限制为 2,000 个,处理预算为 90 秒。文本和注释限制同样适用。如果限制或无法读取的页面中断了扫描,工具会显示部分结果通知,并将导出文件名标记为部分。

我的 PDF 链接会自动打开吗?

不是。提取过程在浏览器中读取文件,不会访问提取出的目标链接。页面按钮用于在 PDF 预览内导航。

轮到您了

保留值及其上下文

提取重点列表,检查源页面,并下载适合您下一步操作的格式。

打开从PDF中提取数据

图片详情

Advertisements

語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina