PDF 转 Excel 转换器

PDF 转 Excel

PDF、提取的表格和下载文件都留在此浏览器中。

正在恢复浏览器私有会话...

选择 PDF

文本型 PDF,最大 20 MiB,最多 150 页。扫描件需要先做 OCR。

正在检测 PDF 中的表格...

未找到规则的文本表格。扫描件需要 OCR,不规则版式可能需要手动整理。

无需上传文档,即可把文本型 PDF 中的规则表格转换为电子表格文件。转换器根据 PDF 可选中文本的位置寻找矩形表格,将可能的表格分别保留,并让你在导出前逐一预览和选择。你可以下载一个 XLSX 工作簿,每个所选表格对应一张工作表,也可以把各表格分别保存为 CSV 或 TSV。扫描件需要先做 OCR,不规则版式仍可能需要手动整理。

如何把 PDF 表格转换为 Excel

  1. 1

    选择文本型 PDF

    选择真实的 PDF 文件,大小不超过 20 MiB,页数不超过 150 页。文件中的文字必须可以选中,纯图片扫描件需要先做 OCR。

  2. 2

    检查检测到的表格

    本地检测器会寻找至少两行且列位置稳定的内容。只选择预览与原文件相符的表格。

  3. 3

    设置 CSV 选项

    导出 CSV 或 TSV 时,可选择逗号、分号或制表符,决定是否加入 UTF-8 BOM。除非你信任 PDF 来源,否则应保持公式防护开启。

  4. 4

    在本地下载

    下载一个包含所选表格的 XLSX 工作簿,或把每个所选表格分别下载为 CSV 或 TSV。

检测器能还原什么,不能还原什么

PDF 页面保存的是带位置的文本,而不是电子表格单元格。本转换器会把位置相近的文本聚为行,寻找重复的列锚点,为缺失位置补空单元格,并排除不像规则表格的内容块。读取文本位置时,它还会考虑页面旋转和可见页面边界。

PDF 内容 可能的结果 需要检查的项目
至少有两列对齐的简单表格 通常会被识别为矩形表格 对照 PDF 检查表头、行顺序和空单元格
一页或多页中有多个独立表格 保留为可分别选择的表格 只选择要加入工作簿的表格
列位置规则的从右到左表格 保留从右到左的视觉顺序 在预览中检查数字和混合文字方向的单元格
段落、标题和页眉页脚等页面元素 通常会因不构成表格而被排除 确认没有误收非表格内容
合并单元格、嵌套表格或跨多行的记录 可能被拆开、错位或排除 手动整理工作表,或使用专业表格提取工具
纯图片扫描件、手写内容或拍照收据 没有可供检测的可选中表格文本 先做 OCR,再尝试可搜索的 PDF

检测器有意采用保守策略。与其把互不相关的页面文字拼成看似可信但内容错误的电子表格,不如直接报告没有找到表格。进行计算、导入或对账前,请始终把重要数值与 PDF 原件逐一核对。

导出格式

XLSX 会为每个所选表格创建一张工作表,一次下载最多包含 200 张工作表。所有提取值都写为文本单元格。转换器不会推断数字、日期、公式、货币或会计格式,也不会重建原文件的边框、字体、合并单元格或页面设计。

CSVTSV 会把每个所选表格分别下载。可选择逗号、分号或制表符作为分隔符。当 CSV 字段含有分隔符、引号或换行时,会使用双引号包围,记录采用 RFC 4180 所记录的常见 CRLF 行尾规则。默认启用 UTF-8 BOM,以提高与电子表格软件的兼容性,但正确的分隔符仍取决于导入时所用的软件和区域设置。

电子表格公式安全

PDF 可能包含以 =+-@ 开头的文本。部分电子表格软件在打开 CSV 时可能把这些文本当作公式执行。公式防护默认开启,它会给类似公式的 CSV 单元格加上前缀,使内容更有可能按文本保留,包括开头有空格或使用全角符号的单元格。

这只能降低风险,不能保证在所有情况下都安全。OWASP 的 CSV Injection 指南 指出,不同电子表格软件的行为并不一致,CSV 再次保存和打开后,转义方式也可能发生变化。对于不受信任的 PDF,请保持防护开启,检查导出的单元格,并且不要启用宏或忽略电子表格软件的安全警告。XLSX 输出会把提取值明确写为字符串单元格,而不是公式。

限制和浏览器私有存储

  • 每次处理一个 PDF,最大 20 MiB,最多 150 页。
  • 如果 PDF 含有过多文本片段、文本量或表格数据,工具会在浏览器可能过载前拒绝处理。
  • 页面预览显示每个检测到的表格前 100 行,导出文件则包含安全限制内检测到的全部行。
  • 一个工作簿最多可包含 200 张所选工作表。
  • 不支持受密码保护或加密的 PDF。请先解锁你有权使用的副本。
  • 在三步流程中,源 PDF、检测到的表格和设置会在此浏览器的私有存储中保留 30 分钟。网站最多保留三个任务,本地任务数据总量不超过 80 MiB。
  • 流程网址中只出现随机任务标识符。PDF、提取值和下载文件不会通过 Livewire 发送,也不会上传到结果服务器。
  • 选择重新开始会删除当前本地任务。工具下次检查浏览器存储时,会删除已过期或无效的记录。

PDF 通过 PDF.js 从本地字节中读取。工具会像普通网页资源一样下载所需程序库,但不会在这些请求中发送你选择的 PDF。

无障碍检查

文件选择控件支持键盘操作,进度和错误会向辅助技术播报,检测到的表格也带有表格说明和列标题。小屏幕上的预览支持横向滚动,并会为从右到左的表格保留检测到的方向。无障碍支持有助于检查提取结果,但当准确性很重要时,仍不能代替与原文件核对。

常见问题

检测器需要可选中的文本,并且这些文本至少排列成两行,列位置要保持稳定。扫描件、单行版式、由绘图命令构成的表单或不规则表格可能不符合条件。对于纯图片页面,请先做 OCR;复杂版式则可改用专业表格提取工具。

不会。它只读取 PDF 中已经嵌入的文本。如果无法在 PDF 阅读器中选择或复制表格文字,请先通过 OCR 制作可搜索的 PDF,再尝试转换该副本。

如果想把所有所选表格放进一个工作簿,并让每个表格对应一张工作表,请选择 XLSX。需要兼容性广泛的文本导入文件时选择 CSV。如果数据中经常出现逗号或分号,或者目标系统明确要求制表符,请选择以制表符分隔的 TSV。

转换器会保留提取到的字符,而不会猜测含义。1,234.5601/02/2026 之类的值在不同区域设置中可能有不同含义。请先确认小数和日期规则,再在电子表格软件中有意识地转换相应列。

开启后,工具会给看似以公式开头的 CSV 单元格添加前缀,包括开头空格之后的 =+-@ 及其全角形式。这样可以降低公式意外执行的风险,但无法保证所有电子表格软件或每次重新保存后的行为都安全。对于不受信任的数据,请保持防护开启并检查结果。

不会。源 PDF、检测到的表格、XLSX 文件以及 CSV 或 TSV 文件都留在你的浏览器中。流程任务在浏览器存储中保留 30 分钟,网址里只放置其随机标识符。重新开始会删除当前本地任务。

可以。工具能够检测 PDF 各页中彼此分开的规则表格。选择所需表格后,可以下载一个最多包含 200 张工作表的 XLSX 工作簿,也可以把每个所选表格分别下载为 CSV 或 TSV。

不一定。工具会考虑页面旋转,但竖排标签、嵌套表格、合并单元格、多行记录和装饰性版式仍可能发生错位或被排除。请查看预览,把总数与 PDF 核对,并在依赖结果前整理电子表格。

相关工具