PDF转HTML转换器

转换为 HTML
下一步

这个转换器读取你PDF中的文本,并将其封装到一个简洁、精简的HTML文件中:每页一个<section>、一个<h2>页面标题以及若干<p>段落。它借助PDF.js完全在你的浏览器中运行,因此文件绝不会被上传。结果是纯文本的简单HTML,你可以打开、编辑或粘贴到CMS中,再用你自己的CSS设置样式。它的目的是把PDF的文本搬到网页上,而不是还原一个经过排版设计的页面。

如何将PDF转换为HTML

  1. 1

    选择你的PDF

    将基于文本的PDF拖入框中,或点击浏览文件。一切都留在你的浏览器里。

  2. 2

    转换为HTML

    PDF.js读取每一页并提取其文本,把行归并成段落。

  3. 3

    检查HTML

    生成的标记会显示在预览框中,方便你查看结果。

  4. 4

    下载文件

    保存一个`.html`文件,每页一个区块,可随时编辑或重新设置样式。

输出结果长什么样

转换器会生成一个结构精简的有效HTML5文件:

元素 来源
<!DOCTYPE html>骨架 采用UTF-8字符集的标准HTML5外壳
<title> 你PDF的文件名
<section data-page> 每个PDF页面对应一个区块
<h2>第N页</h2> 标记每页开始的标题
<p> 按垂直间距归并成段落的文本行

它不做什么

这是一个文本提取工具,而不是排版引擎。它有意包含以下内容:

  • PDF中的图片、徽标或插图。
  • 以HTML<table>/<ul>/<ol>形式呈现的表格、项目符号列表或编号列表。
  • 原始的字体、颜色、分栏或定位。
  • 任何CSS或内联样式。

你得到的是按阅读顺序排列、封装在语义段落中的文字,仅此而已。之后再添加你自己的CSS。

获得最佳效果

  • 使用基于文本的PDF(在阅读器中可以选中文本的那种)。扫描版或纯图片的PDF没有文本层,这里也没有OCR,因此这些页面的输出将为空。
  • 提交前,用prettier --parser html或某个格式化工具处理该文件,整理其中的空白。
  • 要放到WordPress里吗?把HTML粘贴到代码/HTML区块中,而不是可视化编辑器里,后者会重新对其换行封装。

不是排版工具

不要指望HTML看起来和PDF一样。网页是流动的,而PDF页面是固定的。当你想把内容搬到网页上时使用这个工具,然后用你自己网站的CSS重新设置样式。

常见问题

不会。该工具提取文本并把它放进简单的段落中。字体、颜色、分栏和定位都不会被还原。请用你自己的CSS为输出设置样式。

不会。只有文本会被提取。图片、徽标和插图不会被带入HTML。

只有当PDF带有真正的文本层时才行。扫描或拍摄的页面是没有可选文本的图片,这里也没有OCR,因此这些页面不会产生任何文本。

不会。整个转换过程都借助PDF.js在你的浏览器中进行。PDF绝不会离开你的设备,因此处理机密文档也很安全。

相关工具

此工具还提供其他语言版本