HTML到文本转换器

纯文本电子邮件、文本分析及字数统计处理流程均需将HTML转换为人类可直接阅读的字符串(且不含任何标记符号)。只需粘贴HTML代码,该工具便会自动移除所有标签、解析实体标识(例如 &&)、压缩缩进产生的连续空白段,并生成清晰易读的文本块,适用于后续分析或作为多部分邮件中的纯文本内容。

如何将 HTML 转换为文本

  1. 1

    粘贴 HTML

    任意尺寸,片段、完整的邮件正文或整页内容均可。

  2. 2

    转换

    一键完成:移除所有标签和属性,并解码实体。

  3. 3

    检查换行

    段落、列表项和表格行会变成独立行,文本结构因此得以保留。

  4. 4

    复制文本

    输出结果为纯Unicode文本,可安全地输入至词频统计工具、电子邮件模板或情感分析模型中。

转换如何处理复杂的标签

将HTML转换为文本远不止是处理string.replace(/<[^>]+>/, "")那么简单:简单的正则表达式会留下实体代码和缩进空白,也不知道</p>应该开始新的一行。

块级与内联格式

块级标签(<br>,以及闭合标签</p></div></h1></h6></li></tr>)各自产生一个换行。内联标签(<a><span><strong>)不会留空格,因此单词不会合并显示。

各类标签的处理方式

标签 处理
<br> 一个换行
</p></div></h1></h6> 每个闭合标签产生一个换行
</li></tr> 一个换行;不添加项目符号或表格单元格分隔符
<a href="url">text</a> texthref属性被移除
<img alt="text"> 无输出,标签没有可见文本
<script><style> 标签被移除,标签之间的文本保留

实体解码

  • 命名实体(&amp;&copy;&eacute;)会解码为相应的 Unicode 字符。
  • 数值实体(&#169;&#x00A9;)同样会被解码。
  • 未知实体会原样保留,以便分析工具能够识别它们。

空白归一化

  • 换行前的空格和制表符会被移除。
  • 连续三个或更多空行会合并为一个空行。
  • 单词之间的空格保持不变;转换器不会重新排列文本。

用途

  • 生成多部分电子邮件中的 text/plain 部分。
  • 在将抓取的文章传递给语言模型之前进行清洗。
  • 为纯文本搜索索引提供内容。
  • 计算忽略标记的准确字数。

常见问题

视觉格式(加粗、颜色、字体)会丢失,这正是设计的核心目的。结构会以换行的形式保留:段落、列表项和表格行变成独立行,因此文本仍可清晰阅读。

链接的可见文本会保留,但 URL 会连同标签属性一起被移除。如果需要 URL,请改用专用的 HTML 转 Markdown 工具。

转换器只移除标签本身,标签之间的文本会保留,因此 <script><style> 块的内容仍留在输出中。如果不需要,请先从源 HTML 中删除。

是的。输出结果为 UTF-8 编码,并完整保留输入中的所有非 ASCII 字符。诸如 &copy;&eacute; 等实体会解码为对应的 Unicode 字符。

相关工具

此工具还提供其他语言版本