可搜索 PDF 制作工具

选择扫描的 PDF

仅 PDF · 10 MB

仅限 PDF,最大 10 MB 和 10 页

扫描版 PDF 其实只是装在 PDF 容器里的一叠图片,所以你无法高亮、复制或搜索其中的文字。本工具在你的浏览器中对每一页进行光学字符识别(OCR),并把结果作为与原始页面对齐的不可见文本层添加进去。原始页面的视觉内容会保留,Ctrl+F 和文字选择可使用识别出的词语。识别可能出错,而且此输出不是带标签的无障碍 PDF,因此请将重要文字与扫描件核对。

如何对扫描版 PDF 做 OCR

  1. 1

    上传扫描件

    拖入一个扫描版 PDF(合同、发票、归档报告)。印刷体文字效果最好;手写体则不行。

  2. 2

    选择语言

    选择文档语言(英语、西班牙语、法语、德语、意大利语、葡萄牙语或荷兰语),以便 OCR 引擎加载正确的字符模型。

  3. 3

    运行识别

    每一页都会在你的浏览器中以高分辨率渲染,并送入 OCR 引擎。长文档可能需要几分钟。

  4. 4

    嵌入文本层

    识别出的文字会放在与原始页面对齐的不可见文本层中,因此每一页看起来都没有变化。

  5. 5

    下载新的 PDF

    得到一个保留原始扫描件、并可在任何现代阅读器中搜索的 PDF。

OCR 何时效果好(何时不好)

OCR 的质量取决于扫描件。请始终将重要的姓名、数字和法律措辞与原始页面核对。

输入 可以预期的情况
干净的印刷扫描 通常效果较好,但请校对重要文字。
印刷页面的照片 效果取决于对焦、光线和页面角度。
旧书或褪色的打字机印刷 请仔细检查识别出的文字。
手写体或草书 无法可靠地支持。
小票或热敏打印输出 请仔细检查数字和褪色的字符。
背面透印严重的文字 结果可能不完整或不准确。

可搜索 PDF 与纯图片 PDF

  • 纯图片 PDF:纯位图,没有文字。这是扫描仪默认生成的形式。
  • 可搜索 PDF:位图加上不可见的文本层(本工具的输出)。外观完全相同,Ctrl+F 可用。
  • PDF/A:PDF 的归档子集,会内嵌字体并禁止外部资源,常被法院和档案馆要求。本工具生成的是普通的可搜索 PDF,而非经过认证的 PDF/A;如果你的流程需要 PDF/A,请用专门的 PDF/A 工具进行转换和校验。

获得最佳效果的技巧

  • 先从约 300 DPI 开始。 这通常能在可读细节与处理时间之间取得有用的平衡。更高的分辨率会占用更多时间和内存。
  • 在 OCR 之前先校正倾斜。 大多数扫描仪都提供自动旋转,哪怕是轻微倾斜也可能降低识别质量。
  • 每次运行只识别一种语言。 引擎一次只识别一种语言,所以请选择占主导的语言。对于双语文档,可分别用每种语言各运行一次,保留更好的结果。
  • 务必保留原件。 OCR 会带来细微错误;不可见的文本层是为了方便,而非作为证据。

常见问题

原始页面内容会被保留。识别出的文字会作为与其对齐的不可见层添加,因此页面外观应当不会改变。如果精确的视觉保真度很重要,请检查结果。

七种拉丁字母语言:英语、西班牙语、法语、德语、意大利语、葡萄牙语和荷兰语。请选择与你文档相符的语言。西里尔字母、阿拉伯字母以及 CJK(中文、日文、韩文)等文字在本工具中不可用。

不可靠。本工具面向印刷文字。手写识别属于另一种技术,因此请另行检查或转录手写材料。

不是。输出的是普通的可搜索 PDF:你的原始页面图像加上不可见的 OCR 文本层。它不是经过认证的 PDF/A 归档文件。如果你的流程需要 PDF/A,请用专门的 PDF/A 工具转换并校验结果。

OCR 完全在你的浏览器中运行,因此源 PDF 不会为了识别而发送到服务器。普通的本地下载会留在你的设备上。只有当你选择创建下载页面时,完成的可搜索 PDF 才会上传到我们的服务器。源 PDF 仍保留在本地,上传的结果最多保留 7 天。

相关工具