工具150

实用的 PDF 指南

如何使用 OCR 从扫描版 PDF 中提取文本

提取文字,然后进行润色。

识别扫描版 PDF 的单页或选定区域,使用“智能编辑”校对文本,并下载为 TXT 或 Word 文档。

更新于

跟随指南操作
真实工具示例
之前一份四页扫描件的第一页,没有可选文本。
  • 4 页纯图像 PDF
  • 已选择第 1 页
之后使用 Future 引擎从第 1 页下载的实际文本。
  • 第 1 页的可编辑 TXT
  • Future 引擎 · 英语
扫描件包含图像像素;OCR 可生成可编辑的文字。本示例仅处理第 1 页,而非整个文档。
Advertisements
快速视频教程 如何使用 OCR 从扫描版 PDF 中提取文本 提取文字,然后进行润色。 英语旁白 观看视频

如何使用 OCR 从扫描版 PDF 中提取文本

Advertisements

使用 PDF OCR 从页面图像中识别文字。我们的示例从一份四页的纯图像扫描件开始,将其第一页(概述)识别为可编辑文本。

01

选择页面或区域

加载 PDF 并导航至所需页面。使用整页或在所需文本周围调整选择矩形。本示例使用了第 1 页的全部内容。

其他页面或区域需要单独的识别操作。该工具不会自动处理上传 PDF 的每一页。

02

选择语言、引擎和格式

选择页面上印刷的语言。对于我们的英语示例,保持 Future 作为 OCR 引擎,并选择 可编辑文本 (.txt)。

当您需要可搜索的 PDF 时,请选择 Classic,它会保留原始图像并添加一个不可见的识别文本层。Future 提供可编辑文本、Word 以及重排后的纯文本 PDF。

03

识别、校对并下载

选择 开始 并完成显示的验证复选框。将识别结果与原始图像进行比对。我们的下载内容正确包含了“概述”、“规划会议”和“定义结果”。

在复制或下载文本之前,请更正名称、数字和不确定的词汇。更正内容会更新可编辑的导出文件;Classic 的定位搜索 PDF 保留了原始识别结果,因此请单独检查该文件。

04

使用智能编辑润色识别出的文本

对于 TXT 或 Word 结果,请选择 智能编辑(位于 复制 旁边)。选择一段文字进行处理,或不选择任何内容以处理整个草稿。选择 总结文本、改写文本、修正语法 或 建议标题,然后选择 应用。标题操作会在文本上方添加一个标题。

根据扫描件检查 AI 的每一次修改,特别是名称、数字和遗漏的词汇。建议内容会保留在智能编辑中,直到您选择 应用更改。TXT 和 Word 下载将使用编辑后的纯文本。格式化复制 会下载一个带有编辑器样式的独立 HTML 文件;原始扫描件和 Classic 可搜索 PDF 的文本层不会改变。

一些有用的细节

常见问题

我可以只识别一个段落吗?

可以。在开始之前,在它周围选择一个矩形。检查边缘,确保附近的文本被排除在外,且重要的词汇没有被截断。

Future 会在 PDF 中保留原始页面设计吗?

其 PDF 是重排后的纯文本文件。当目的是保留带有文本层的扫描页面图像时,请选择 Classic 的可搜索 PDF。

智能编辑可以更改可搜索的 PDF 吗?

不能。智能编辑适用于 TXT 和 Word 结果。“应用更改”会更新可编辑文本;它不会重写扫描页面或之前生成的搜索 PDF。

轮到你了

用您的文档试一试

检查结果,然后保存您需要的版本。

打开 PDF OCR

图片详情

Advertisements

語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina