PDF 表格转 CSV

PDF 表格转 CSV

选择文本型 PDF

无需把 PDF 发送到服务器,即可将简单的文本型 PDF 表格转换为 CSV 或 TSV。浏览器按页面上的可见位置组合文本片段,并寻找重复的列基准。请在下载前逐一核对检测到的表格,因为这是一个偏保守、尽力而为的提取器,并不能保证复杂的 PDF 版式都能还原成准确的行列。

如何把 PDF 表格提取为 CSV

  1. 1

    选择文本型 PDF

    选择不超过 20 MiB、150 页的 PDF。只有页面图像的扫描件需要先做 OCR。

  2. 2

    让浏览器检测表格

    提取器使用可见文本坐标,包括页面旋转和 CropBox,再寻找重复出现的行列位置。

  3. 3

    核对并设置输出

    选择需要的表格,检查补出的空白单元格,再选择逗号、分号或制表符以及 UTF-8 标记和公式防护。

  4. 4

    下载所选表格

    每个所选表格会在本地生成单独的 CSV 或 TSV 下载。跨页表格不会自动拼接。

检测器能推断什么,不能推断什么

PDF 通常保存的是带坐标的文本片段,而不是带明确行列的表格网格。本工具会组合位于同一可见行的文本片段,并保留多行中重复出现的列位置。一个页面中的多个规则表格可以分别识别,模式明确时也会忽略单列正文。

可见坐标计算会考虑页面旋转和偏移的 CropBox。对于以从右到左文字为主的行,列顺序遵循 PDF 文本层提供的方向。即使如此,检测器也无法重建所有版式。

PDF 版式 可能的结果 核对重点
列位置重复的整洁导出文件 通常效果最好 表头、小数点和空白单元格
规则行中缺少一个值 在推断的列中补空白单元格 留空的列是否正确
合并单元格或换行文字 可能拆分、错位或合并 对照 PDF 检查预览
一页有多个规则表格 可能分别识别 只选择需要的表格
扫描页面图像 检测不到表格 先运行 OCR

除了 20 MiB 和 150 页限制外,还有文本安全上限:每页最多 100,000 个文本片段或 250,000 个字符,整份文档最多 1,000,000 个片段或 5,000,000 个字符。因此,即使文件大小和页数未超限,文本被切分得过于零碎的 PDF 也可能停止处理。

CSV、TSV 与电子表格安全

输出可选择逗号、分号或制表符;制表符输出保存为 TSV。记录使用 CRLF 换行。字段中含有所选分隔符、双引号、回车或换行时,会用双引号包裹;字段内的双引号会写成两个双引号。这遵循 RFC 4180 记载的常见规则,并针对所选分隔符作了调整。

公式防护默认开启。若单元格去除前导空白后以 =+-@ 开头,包括支持的全角形式,工具会加上单引号,让电子表格软件更可能把它当作文本。此前缀会改变单元格值。关闭防护可保留原始提取文字,但在电子表格中打开不可信 PDF 中类似公式的内容可能有风险。OWASP 的 CSV 注入说明指出,没有一种防护能适用于所有电子表格软件及后续另存操作。

可选的 UTF-8 标记能帮助部分软件识别非拉丁文字。无论选择哪种设置,用于财务、报告或自动导入前都应检查下载文件。

私密的步骤状态

PDF、检测到的表格和选项都只留在当前浏览器中。它们会在有容量限制的本地浏览器存储中保留最多 30 分钟,以便三步流程在页面切换后继续。下载文件均在本地生成,本工具不会上传任何内容。重新开始会删除当前任务;浏览器的存储策略或隐私模式也可能更早清除数据。

常见问题

不会。PDF 读取、表格检测以及 CSV 或 TSV 生成都在浏览器中完成。当前任务会在本地保留最多 30 分钟以便继续后续步骤,所有下载也都在本地生成。

如果 PDF 只有页面图像,则不能直接使用。提取器需要 PDF 文本层及其位置。请先运行 OCR,再使用生成的文本型 PDF。

可选择逗号、分号或制表符。记录使用 CRLF。包含所选分隔符、双引号、回车或换行的字段会用双引号包裹,字段内的双引号会写成两个。制表符输出使用 .tsv 扩展名。

对于去除前导空白后以 =、+、- 或 @ 开头、形似电子表格公式的单元格,工具会添加单引号。此功能默认开启,并会改变这些值。只有在必须保留原文且信任 PDF 时才应关闭。

检测依赖重复的文本位置,而不是真实的 PDF 表格单元格。换行文字、合并单元格、异常间距、混合书写方向和装饰性版式都可能拆分或移动数值。页面旋转与 CropBox 会被归一化,但仍须对照源文件检查预览。

一个页面中的多个规则表格可以分别检测并单独选择,每个所选表格下载为一个文件。延续到下一页的表格不会自动拼接。

相关工具