从 PDF 中提取图像

上传 PDF

上传PDF文件即可恢复所有嵌入图像的原始分辨率。该提取工具会遍历PDF对象树,识别/XObject /Image格式条目,并将每张图像导出为PNG格式,无需截屏,且不会因整页光栅化处理导致画质损失。适用于扫描文档、图文密集型报告、产品目录及宣传册等场景。

如何从 PDF 中提取图像

  1. 1

    上传 PDF

    仅可上传单个文件;加密的PDF文件需先解密。

  2. 2

    扫描对象树

    该提取器会遍历所有页面中的每个图像XObject。

  3. 3

    预览结果

    您可将每张图像视为带有页码及尺寸的缩略图。

  4. 4

    单独下载或作为 ZIP 文件下载

    可选取单个资产或导出整个文件至名为`image-p1-1.png`的归档文件中。

图像如何存在于 PDF 中

PDF文件将图像作为独立资源(/XObject数据流)存储于页面内容中。提取工具以原始编码格式读取每个数据流,并重建作者嵌入的文件内容。

您将看到的格式

PDF过滤器 您获得的格式 常见源文件
/DCTDecode PNG(来自 JPEG) 照片、产品图片及扫描文件
/FlateDecode + RGB PNG 格式 标志、图表及用户界面截图
/JPXDecode PNG(来自 JPEG 2000) 高分辨率存档扫描图像
/CCITTFaxDecode PNG(来自扫描件) 黑白扫描文本
/JBIG2Decode PNG(已转换) 压缩扫描文档

提取器输出的始终是PNG:它会在您的浏览器中重新编码原始像素,因此JPEG、JPEG 2000和CCITT来源的图像也以PNG格式提供。

它无法恢复的内容

  • 矢量插图。 使用PDF路径运算符绘制的徽标并非图像,它们存在于内容流中,而非作为XObject存在。此类情况下请使用PDF转 SVG 工具处理。
  • 背景颜色与渐变效果。 这些属于页面级别的图形元素,而非嵌入式资源。
  • 以轮廓形式呈现的文本。 显示为“图形“,但并非图像对象。

处理导出时的实用建议

  • **检查尺寸。**页面上的 300x300 小图可能实际上是原始图像(3000x3000 像素)在渲染时缩小后的版本;您获取的是源像素数据,而非显示尺寸。
  • 请遵守许可条款。 仅凭能够提取图像并不意味着您拥有重新使用的权利。从PDF文件中提取的库存图片仍为库存图片。
  • 扫描文档。 若每页均生成一张包含文本的完整图像,则该PDF文件即为扫描件。可对导出的PNG文件运行OCR以恢复文本内容。

常见问题

PDF页面可对图像绘制方式应用变换矩阵(翻转、旋转、倾斜)。提取器会返回存储的位图,即原始像素数据。若发布者将图像以倒置形式存储并在渲染时进行翻转,则导出结果将呈现倒置状态;可在任意图像编辑器中将其恢复为正常旋转状态。

请先解锁文件:首先使用PDF解密工具打开文件并输入所有者密码,然后进行提取。

是的。图像按页面顺序添加,每个文件名都带有页码,例如image-p1-2.png,因此您可以知道每张图像来自哪一页。

不会。源PDF文件会在您的浏览器中完整打开并读取,绝不会发送到服务器。仅会上传包含所提取图像的ZIP文件,用于生成受会话保护的结果;该文件最多保留7天,随后被删除。

相关工具

此工具还提供其他语言版本