工具150

实用的 PDF 工具,化繁为简

从PDF中提取数据.

查找您需要的数据。保留每个结果的来源页面。

Advertisements
您的 PDF 工作区
在您的设备上处理
或将文件拖放到此处
您的 PDF 在此浏览器中进行处理。 PDF
Advertisements

如何从PDF中提取数据

  1. 01

    选择一个 PDF

    加载包含可选择文本的文档,或尝试示例。

  2. 02

    提取并查看

    选择“提取”。查看值、计数和源页面;筛选或排序列表。

  3. 03

    复制或下载

    复制值,或下载包含页面引用的 CSV 或简单的 TXT 列表。

博客如何从 PDF 中提取结构化数据阅读指南

将PDF中的结构化值提取为CSV或文本

选择您需要的数据类型:电子邮件、电话号码、URL、数字日期、IPv4地址、域名、DOI、ISBN、标签和MAC地址。查看带有计数和页面引用的提取值。

识别出的值将成为带有来源页面引用的列表。
快速视频教程 如何从 PDF 中提取结构化数据 将联系人和研究标识符收集到一个有组织的列表中。 英语旁白 观看视频

如何从 PDF 中提取结构化数据

这有什么用?

研究

收集标识符

收集DOI和ISBN值及其出现的页面。

报告

提取数字详情

查找日期条目和IPv4地址。

目录

建立联系人列表

将电子邮件、电话和网页链接合并为一个结构化的导出文件。

功能与控制

选择有用的数据类型

从电子邮件、电话和 URL 开始,然后打开“更多数据类型”以获取专业数值。

识别器支持的内容

日期必须使用带有四位年份的数字格式;模棱两可的日/月数值将保留其原始顺序。IPv4 八位组会经过验证;不包含 IPv6。

域名是从可识别的电子邮件和网页链接中提取的,而非任意文件名。DOI 提取涵盖常见的现代 DOI 格式,而非所有历史格式。ISBN-13 值需要有效的校验和;ISBN-10 也需要 ISBN 标签。标签(Hashtag)可以包含 Unicode 字母,包括阿拉伯语。

MAC 地址使用六组由冒号或连字符分隔的对。本工具绝不会联系提取出的地址或标识符。

查看数值及其来源页面

检查计数、跳转至 PDF 页面并筛选结果列表。

查看与整理

每个结果都会记录其在 PDF 中的物理页面位置,这可能与打印的页码不同。选择一个页面标签即可打开预览并查看大致的高亮显示。

“移除重复项”默认开启。计数会合并相同数值的识别重复项;关闭此选项可查看单独出现的次数。按字母顺序排序可更改列表顺序。筛选功能同时适用于复制、下载以及可见行。

复制值或下载结构化列表

选择 CSV 以获取计数和页码,或选择 TXT 以每行一个值的方式导出。

每次下载包含的内容

CSV 包含类型、值、计数和页码列。UTF-8 编码支持阿拉伯语和其他脚本。可能被解释为电子表格公式的值会加上撇号前缀,以便更安全地导入。

TXT 和“复制全部”仅包含值,每行一个。即使屏幕上的表格跨越多个结果页面,所有符合过滤条件的行都会被包含在内。不会创建新的 PDF,源 PDF 也保持不变。

保持大规模提取的可管理性

在浏览器中处理一个 PDF,并设有明确的限制和部分结果通知。

文件、限制和扫描页面

加载单个最大 50 MiB 和 500 页的 PDF。提取过程会检查每页最多 250,000 个字符和 2,000 个匹配项,总体最多 1,000 万个字符和 20,000 个匹配项,以及每页 2,000 个注释。90 秒的提取预算限制了长时间的运行。非常复杂的文档在拆分为较小的文件时效果更好。

当达到限制或页面无法完全读取时,结果会显示通知,且受限或失败的运行会在文件名中导出 partial 标识。没有可选文本的页面会被单独计算。请对纯图像扫描件使用 PDF OCR,然后再返回提取识别出的文本。

PDF 内容在此浏览器中进行本地处理。上传的文档不会发送到提取服务器。PDF 内发现的链接、电子邮件地址和电话号码绝不会被自动联系。

支持的文件与处理

输入
PDF
输出
CSV / TXT

打开一个最大 50 MB 且最多 750 页的 PDF。复杂文档可能会受到额外的输出、内存和处理限制。

处理过程在您的设备上进行,无需上传文档。请在关闭页面前下载结果;请单独保存原始文件。

Advertisements
常问问题

一些有用的解答

在开始前了解预期效果。

在您的设备上处理
此工具可以识别什么?

选择您需要的数据类型:电子邮件、电话号码、URL、数字日期、IPv4 地址、域名、DOI、ISBN、标签和 MAC 地址。查看带有计数和页面引用的提取值。此工具提取的是可识别的值,而非表格、发票或语义字段。模式匹配和校验和可减少干扰,但不能保证完整性,也不能证明标识符是真实的。

我可以从扫描的 PDF 中提取数据吗?

仅读取可选择的文本和识别出的链接目标。纯图像页面需要先进行 PDF OCR。运行 OCR,下载可搜索的 PDF,然后返回此提取器。

如何处理重复项和计数?

“移除重复项”功能会合并识别出的等效值。“计数”显示检测到的出现次数,“页面”列出物理 PDF 页面位置。禁用此选项可保持各项独立。同一页面上的打印目标和匹配的可点击链接不会被重复计算。

CSV 和 TXT 有什么区别?

CSV 包含类型、值、出现次数和页面引用。TXT 和“全部复制”仅提供值,每行一个。所有匹配当前筛选器的行都会被包含,而不仅仅是当前可见的表格页面。

PDF 是否会上传进行提取?

不会。PDF 解析、匹配和导出均在此浏览器中运行。原始 PDF 保持不变。提取出的任何链接、电子邮件或电话号码都不会被自动联系。

有什么限制吗?

单个 PDF 最大 50 MiB 和 500 页。提取限制为每页 250,000 个文本字符和 2,000 个匹配项,总计 1,000 万个字符和 20,000 个匹配项,以及每页 2,000 个注释。如果因限制或页面无法读取导致结果不完整,系统会显示提示。

继续

接下来您想做什么?

选择一个工具。您完成的 PDF 将随您一同前往。

PDF

Advertisements

語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina