PDF OCR 文字识别
此 OCR 会话已不可用
选择扫描版 PDF
仅 PDF · 20 MB · 40 页
或将一个 PDF 拖放到这里
如果 PDF 中保存的是扫描页面图片,而不是可以选中的文字,可以使用此工具。它会在浏览器中渲染每一页并运行光学字符识别(OCR),然后显示识别出的纯文本,供你核对、复制或保存为 .txt 文件。源 PDF 始终留在你的设备上。此工具不会制作可搜索的 PDF,也不会保留页面版式。OCR 结果可能有误。
如何从扫描版 PDF 提取文字
-
1
选择文档语言
选择印刷文字使用的主要语言。浏览器会根据此选项使用相应的 OCR 模型。
-
2
打开 PDF
选择一个不超过 20 MB、最多 40 页的 PDF。源文件留在浏览器中,不会发送到我们的服务器。
-
3
等待识别完成
浏览器逐页渲染,再使用所选 OCR 模型读取文字。开始识别前可能需要先下载模型文件。
-
4
核对结果
将姓名、数字和重要段落与原始页面逐一比对。OCR 只能辅助转录,重要用途不能直接依赖未经核对的结果。
-
5
复制或下载文字
复制操作会将结果保留在浏览器中。“在本地下载 TXT”不会上传文件。创建受保护的下载页面是另外一项可选操作。
工具会生成什么
输出内容是纯文本,每一页识别出的文字前都有页码标记。此工具不会:
- 在 PDF 中添加隐藏文字层
- 重建原来的分栏、表格、表单或字体样式
- 保留页面的视觉版式
- 翻译文档
- 验证识别结果是否正确
如果你需要保留扫描页面外观,同时让 PDF 可以搜索文字,请使用专门制作可搜索 PDF 的工具或桌面 OCR 软件。
哪些文档更适合识别
OCR 主要用于印刷文字。页面端正、图像清晰、对比度合适的扫描件比模糊照片、褪色传真或破损页面更容易识别。装饰字体、手写内容、数学符号、紧密分栏和复杂表格可能导致文字识别错误或顺序混乱。
工具接受最大 20 MB、最多 40 页的 PDF。识别按页进行,可能占用较多内存,尤其是尺寸较大或分辨率较高的页面。如果浏览器内存不足,请先拆分 PDF,再分别处理较小的文件。
支持的 OCR 语言
可选择英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、日语、简体中文、韩语或阿拉伯语。
打开文件前,请选择文档的主要语言。同一页面混用多种语言或文字体系时,可能需要分别识别多次,形状相近的字符仍有可能混淆。
务必核对识别文字
使用结果前,请始终与原始 PDF 对照,尤其要检查:
- 姓名、地址和证件号码
- 日期、金额、小数点和负号
- 法律、医疗、财务或安全说明
- 多栏文档中的分页和阅读顺序
不要把 OCR 输出当作重要文档的权威副本。
文件处理与下载
源 PDF 只在浏览器本地读取,不会写入步骤链接,也不会发送到我们的服务器。浏览器可能从已配置的库提供方下载 PDF 渲染库、OCR 库和所选语言模型。
复制会将识别文字保留在浏览器中并写入剪贴板。在本地下载 TXT会生成派生的 .txt 文件并直接保存,不会上传。如果另行选择创建下载页面,工具只会上传这份派生文本文件,用于生成受保护的链接,文件最长可保留 7 天。如果这项可选上传失败,本地下载仍然可用。
常见问题
不会。渲染页面和识别文字时,源 PDF 始终留在浏览器中。浏览器可能下载 PDF 渲染库、OCR 库和所选语言模型。复制和在本地下载 TXT 都不会上传识别文字,只有单独选择“创建下载页面”时才会上传派生的纯文本文件。
不会。输出是按页整理的纯文本。工具不会修改原始 PDF、添加隐藏文字层或保留原版式。
请与原始页面逐项核对。OCR 可能混淆字符、遗漏文字或改变阅读顺序。用于法律、医疗、财务、安全或其他重要事项前,必须检查每一处细节。
此工具针对印刷文字设计。手写内容、公式和装饰字体的识别结果可能不可靠。表格中的字符可能被读出,但行列结构不会保留在纯文本结果中。
英语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语、日语、简体中文、韩语和阿拉伯语。打开 PDF 前请选择主要语言。
PDF 最大 20 MB,最多 40 页。尺寸很大或细节很多的页面仍可能超出浏览器可用内存,遇到这种情况可以把文档拆成较小的文件。
“在本地下载 TXT”会从识别文字生成 .txt 文件,不会上传。如果选择“创建下载页面”,派生文件会上传到受保护的链接,最长可保留 7 天。即使这项可选上传失败,本地下载仍然可用。
相关工具
PDF 转 JPG 转换器
按所需分辨率和质量将 PDF 页面转换为 JPG 图片。可下载单个页面,也可将全部页面打包为 ZIP。
拆分 PDF
将 PDF 拆分为每页一个文件,或按 1-3、4-6、8 这样的自定义范围拆分。在浏览器中处理并下载 ZIP。
PDF 转 Word
将 PDF 转换为可完整编辑的 Word 文档。保留标题、列表、图片和表格。扫描版 PDF 会自动经过 OCR 处理。
Excel 转 PDF 转换器
在浏览器中将 XLSX、XLS 或 CSV 文件转换为横向 A4 PDF。每个工作表都会变成清晰的表格页面,可直接下载。
从 PDF 中删除页面
从 PDF 中删除选定页面或页面范围。输入 2, 5-7 这样的页码,至少保留一页,然后下载精简后的 PDF。
PDF 转 Excel 转换器
检测文本型 PDF 中的规则表格,在本地下载 XLSX、CSV 或 TSV。导出前可逐表检查。上限为 20 MiB 和 150 页。