PDF OCR 文字识别

选择扫描版 PDF

仅 PDF · 20 MB · 40 页

或将一个 PDF 拖放到这里

如果 PDF 中保存的是扫描页面图片,而不是可以选中的文字,可以使用此工具。它会在浏览器中渲染每一页并运行光学字符识别(OCR),然后显示识别出的纯文本,供你核对、复制或保存为 .txt 文件。源 PDF 始终留在你的设备上。此工具不会制作可搜索的 PDF,也不会保留页面版式。OCR 结果可能有误。

如何从扫描版 PDF 提取文字

  1. 1

    选择文档语言

    选择印刷文字使用的主要语言。浏览器会根据此选项使用相应的 OCR 模型。

  2. 2

    打开 PDF

    选择一个不超过 20 MB、最多 40 页的 PDF。源文件留在浏览器中,不会发送到我们的服务器。

  3. 3

    等待识别完成

    浏览器逐页渲染,再使用所选 OCR 模型读取文字。开始识别前可能需要先下载模型文件。

  4. 4

    核对结果

    将姓名、数字和重要段落与原始页面逐一比对。OCR 只能辅助转录,重要用途不能直接依赖未经核对的结果。

  5. 5

    复制或下载文字

    复制操作会将结果保留在浏览器中。“在本地下载 TXT”不会上传文件。创建受保护的下载页面是另外一项可选操作。

工具会生成什么

输出内容是纯文本,每一页识别出的文字前都有页码标记。此工具不会:

  • 在 PDF 中添加隐藏文字层
  • 重建原来的分栏、表格、表单或字体样式
  • 保留页面的视觉版式
  • 翻译文档
  • 验证识别结果是否正确

如果你需要保留扫描页面外观,同时让 PDF 可以搜索文字,请使用专门制作可搜索 PDF 的工具或桌面 OCR 软件。

哪些文档更适合识别

OCR 主要用于印刷文字。页面端正、图像清晰、对比度合适的扫描件比模糊照片、褪色传真或破损页面更容易识别。装饰字体、手写内容、数学符号、紧密分栏和复杂表格可能导致文字识别错误或顺序混乱。

工具接受最大 20 MB、最多 40 页的 PDF。识别按页进行,可能占用较多内存,尤其是尺寸较大或分辨率较高的页面。如果浏览器内存不足,请先拆分 PDF,再分别处理较小的文件。

支持的 OCR 语言

可选择英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、日语、简体中文、韩语或阿拉伯语。

打开文件前,请选择文档的主要语言。同一页面混用多种语言或文字体系时,可能需要分别识别多次,形状相近的字符仍有可能混淆。

务必核对识别文字

使用结果前,请始终与原始 PDF 对照,尤其要检查:

  • 姓名、地址和证件号码
  • 日期、金额、小数点和负号
  • 法律、医疗、财务或安全说明
  • 多栏文档中的分页和阅读顺序

不要把 OCR 输出当作重要文档的权威副本。

文件处理与下载

源 PDF 只在浏览器本地读取,不会写入步骤链接,也不会发送到我们的服务器。浏览器可能从已配置的库提供方下载 PDF 渲染库、OCR 库和所选语言模型。

复制会将识别文字保留在浏览器中并写入剪贴板。在本地下载 TXT会生成派生的 .txt 文件并直接保存,不会上传。如果另行选择创建下载页面,工具只会上传这份派生文本文件,用于生成受保护的链接,文件最长可保留 7 天。如果这项可选上传失败,本地下载仍然可用。

常见问题

不会。渲染页面和识别文字时,源 PDF 始终留在浏览器中。浏览器可能下载 PDF 渲染库、OCR 库和所选语言模型。复制和在本地下载 TXT 都不会上传识别文字,只有单独选择“创建下载页面”时才会上传派生的纯文本文件。

不会。输出是按页整理的纯文本。工具不会修改原始 PDF、添加隐藏文字层或保留原版式。

请与原始页面逐项核对。OCR 可能混淆字符、遗漏文字或改变阅读顺序。用于法律、医疗、财务、安全或其他重要事项前,必须检查每一处细节。

此工具针对印刷文字设计。手写内容、公式和装饰字体的识别结果可能不可靠。表格中的字符可能被读出,但行列结构不会保留在纯文本结果中。

英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、日语、简体中文、韩语和阿拉伯语。打开 PDF 前请选择主要语言。

PDF 最大 20 MB,最多 40 页。尺寸很大或细节很多的页面仍可能超出浏览器可用内存,遇到这种情况可以把文档拆成较小的文件。

“在本地下载 TXT”会从识别文字生成 .txt 文件,不会上传。如果选择“创建下载页面”,派生文件会上传到受保护的链接,最长可保留 7 天。即使这项可选上传失败,本地下载仍然可用。

相关工具