PDF 摘要工具

第 1 步,共 3 步

正在打开私有摘要会话...

选择文本型 PDF

请使用一个不超过 20 MiB、150 页的 PDF。工具会读取已有文本层;扫描页面需要先做 OCR。

或将一个 PDF 拖放到此处

正在加载……

大型文档可能需要一些时间。你可以安全停止,且不会保留不完整结果。

本工具读取 PDF 中嵌入的文本层,按重复词语为句子评分,再按提取顺序展示入选句子。它不使用 AI,不改写内容,也不核查事实。PDF 和提取出的文本都留在浏览器中,因此结果适合用来快速初读,不能替代对原文的仔细审阅。

如何为 PDF 生成摘要

  1. 1

    选择文本型 PDF

    选择一个有效 PDF,文件不超过 20 MiB、150 页。扫描件或只有图片的 PDF 需要先做 OCR。

  2. 2

    在浏览器中提取文本

    工具在本地读取嵌入文本;提取内容超过 2,000,000 个字符时会停止。受密码保护、损坏或无法读取的文件会被拒绝。

  3. 3

    设置摘要长度

    选择 3 至 20 句话。如果文档较短,工具会显示全部可用句子,不会虚构额外内容。

  4. 4

    核对并复制

    先将入选句子和高频词与原始 PDF 对照,再复制摘要。

抽取式摘要实际做了什么?

抽取式摘要保留来源中的原句,而不是另写一段新文字。本工具统计有用词语,为靠前的句子增加少量权重,选出得分较高的句子,再将它们恢复为提取时的顺序。

简单示例

假设一份项目简报包含以下四句话:

  1. 试点项目缩短了支持服务的平均等待时间。
  2. 团队还重新设计了培训手册。
  3. 第二轮推广后,等待时间再次缩短。
  4. 报告建议每月监测等待时间。

由于等待时间反复出现,第 1、3、4 句的排名可能高于第 2 句。如果把摘要长度设为三句话,结果会按 1、3、4 的顺序保留这些原句。工具不会另写结论,也不会判断报告内容是否正确。

处理方式

阶段 实际行为
读取 PDF 使用 PDF.js 读取嵌入文本层,不执行 OCR
划分句子 环境支持时按页面语言使用 Intl.Segmenter,并提供基于 Unicode 标点的备用规则
划分词语 环境支持时采用相应语言的分词方式,并过滤一小组常见词
排名 根据词语重复情况和少量开头位置权重为句子评分
输出 按提取顺序保留入选句子,并列出最多 12 个高频词

重要限制

  • 分栏、表格、页眉、页脚和特殊字体编码可能导致提取顺序与页面上的视觉阅读顺序不同。
  • 分句和分词由当前页面语言引导,工具不会自动识别整份 PDF 的语言。
  • 即使句子原样取自来源,脱离周围段落或表格后仍可能失去关键语境。
  • 工具不会核查事实、解决矛盾或评估证据。
  • 上限为 20 MiB、150 页和 2,000,000 个提取字符。

三步流程中的隐私

源 PDF 和提取文本保存在浏览器存储中。URL 内难以猜测的 ID 只指向本地记录,该记录会在 30 分钟后过期。页面和 PDF 库仍会下载常规资源,但这些请求不会携带你的 PDF;文件也不会发送到我们的服务器或发送至转换服务。

常见问题

不使用。它按照确定的词频评分从提取文本中选句,不会改写来源、生成新主张或核查事实。

不能直接处理。只有页面图片的扫描件没有可读取的文本层。请先做 OCR,再使用生成的可搜索 PDF。

PDF 保存的是带位置的文本,而非普通段落。分栏、表格、页眉、页脚和特殊字体可能改变文本提取顺序。

工具让浏览器按页面语言划分句子和词语,包括不在每个词之间使用空格的语言。它提供 Unicode 标点备用规则,但不会自动识别 PDF 语言。

请使用一个不超过 20 MiB、150 页和 2,000,000 个提取字符的 PDF。受密码保护、损坏或无法读取的文件会被拒绝。

不会。PDF 和文本留在浏览器中。三步流程的私有本地记录最多保留 30 分钟,URL 只包含难以猜测的 ID。

相关工具