PDF 转文本转换器

下一步:检查

从 PDF 中取出文字最快的方法。这个工具会逐页读取 PDF 中已经存储的文本层,交给你可以复制或另存为 .txt 文件的纯文本。全部在你的浏览器中运行,因此你的文档绝不会被上传。有一点要先说清楚:它读取的是文件里已经存在的文本,所以扫描或拍照得到的文档(没有文本层的图片)会得到空结果。遇到这种情况,请改用 OCR 工具。

如何从 PDF 中提取文本

  1. 1

    上传 PDF

    把它拖进来或点击选择。文件留在你的设备上,绝不会发送到服务器。

  2. 2

    提取文本

    工具会读取每一页的文本层并拼接起来,在每一页之前加上一个标记。

  3. 3

    查看结果

    提取出的文本会显示在框中,一页接一页,方便你核对。

  4. 4

    复制或下载

    把它复制到剪贴板,或另存为 .txt 文件以便在别处再次使用。

这个工具能读什么,不能读什么

PDF 类型 结果
从 Word、Google Docs、浏览器或设计工具导出 文本完整、干净、无缺漏
带有正规文本层的数字 PDF 逐页提取文本
保存为 PDF 的扫描件或照片(仅图片) 空或几乎为空:没有文本可读
有密码保护的 PDF 未先解锁便无法读取

这里没有 OCR:扫描件请用对的工具

这个提取器不运行 OCR(光学字符识别)。它复制的是 PDF 内部已有的文本,并不读取像素。如果你的文件是扫描件而什么也没提取到,请先让它经过 OCR 工具,把图片转成真正的文本层,之后你就能提取了。

文本是如何排布的

每一页之间用一个 --- Page N --- 标记分隔,让你看清一页在哪里结束、下一页从哪里开始。文本按它在 PDF 中存储的顺序被取出。大多数文档读起来很自然;少数采用不寻常多栏排版的文档可能会把各栏交错在一起,因为工具遵循 PDF 中存储的顺序,而不是猜测阅读路径。

常见用途

  • 喂给 AI 模型。 语言模型接收纯文本,而不是 PDF。先提取出来能让一切更快、更可预期。
  • 引用与搜索。 复制一段文字,无需与 PDF 阅读器的选择功能较劲。
  • 重复利用内容。 把文本转移到文档、电子邮件或笔记中,无需重新输入。

常见问题

无效。它读取的是内嵌的文本层,而扫描件只是一张没有文本层的图片,所以结果为空。扫描或拍照的文档请用 OCR 工具,然后再提取文本。

不会。提取完全在你的浏览器、你自己的设备上进行。PDF 绝不会发送到服务器,也不会存储任何内容。

少数 PDF,尤其是多栏排版,存储文本的顺序与你阅读的顺序不同。工具遵循 PDF 中存储的顺序,所以各栏可能交错。从文字处理软件导出的文档几乎总能正确输出。

在锁定状态下不能。请先用 PDF 解锁工具去掉密码,然后再提取文本。

相关工具

此工具还提供其他语言版本