乱码检查工具

比较编码假设
粘贴的文本和所有候选结果都只保留在此浏览器中。漏斗模式会在当前标签页中保存一条经过验证的记录,最长30分钟,并且URL中只会出现一个不透露内容的任务ID。任何内容都不会通过我们的服务器或还原API发送。

粘贴看起来乱码的文本

粘贴类似café的文本,或因编码不匹配而无法阅读的日文字符串。编辑框中的原文会保持不变。

最多50,000个字符。本工具只比较粘贴的Unicode文本,不检查或修复文件、字节流、数据库或HTTP标头。

Mojibake,也就是乱码,是指字节被不兼容的字符集解码后,数据显示成错误字符的现象。常见示例是café:原文café以UTF-8编码,但它的字节却被当成Latin-1或Windows-1252解释。粘贴当前显示的文本,即可比较能够严格往返转换的还原假设。工具始终保留原文,把每个候选结果明确标为假设,并且只在浏览器本地完成比较。

如何比较乱码文本还原假设

  1. 1

    粘贴当前显示的文本

    按收到时的原样使用文本。本工具不会上传或检查源文件。

  2. 2

    同意进行比较

    让浏览器用严格的UTF-8解码器检验Latin-1和Windows-1252字节解释。

  3. 3

    比较而不先下结论

    将未更改的原文与每个可逆候选结果逐一比较,只在上下文支持时选择。

  4. 4

    作为纯文本使用

    复制、下载或打印所选假设,不会覆盖原文。

还原假设能说明什么,不能说明什么

字符编码规定字符与字节之间的对应关系。UTF-8用两个字节C3 A9表示é。如果软件将这两个字节按Windows-1252或ISO-8859-1解码,屏幕上可能出现é。一种有用的还原假设会反向处理这类特定错误:把当前显示的旧式字符视为字节值,严格按UTF-8解码这些字节,再确认将候选结果重新编码为UTF-8后能得到完全相同的字节。

往返检查会排除不完整或格式错误的UTF-8序列。包含替换字符的候选结果也会被排除,因为该字符所替代的信息已经丢失。往返有效只能支持一种假设,不能证明源系统实际使用了哪种编码,也不能证明作者原本想表达什么。

当前显示的文本 检验的假设 可能的候选结果 需要核对的内容
café UTF-8字节被当作Latin-1读取 café 与原始来源核对拼写
It’s UTF-8字节被当作Windows-1252读取 It’s 检查标点和文档规范
文字化け UTF-8字节被当作Latin-1读取 文字化け 与可信的日文原文核对
café 连续发生两次编码错误 café 检查两次受限转换

为什么日文文本需要上下文

日文UTF-8字节如果通过错误的旧式字符集解码,可能变成长串拉丁字母、符号和类似控制字符的内容。可逆性有助于缩小候选范围,但简短姓名或单独字符仍可能有多种解释。请将候选结果与原始文档、数据库导出的源记录、发送者提供的文本或其他权威副本核对。

工具限制与更安全的恢复方式

本工具接收的是浏览器已经解码为Unicode的文本。它无法找回此前被丢弃的字节,不能从二进制文件推断编码,不能修复数据库字段,也不能更改HTTP的Content-Type标头。如果没有候选结果,请保留原文。尽可能取得真正的源字节并创建备份,确认声明编码和实际编码,然后使用专门处理文件或字节流的工具正确解码一次。不要把损坏的文本反复覆盖到唯一的源副本上。

常见问题

不是。这只表示某一种旧式字节解释能够解码为有效UTF-8,并通过完全一致的字节往返检查。多种解释可能产生相同或不同但可读的文本,仍然需要结合上下文和权威来源判断。

当前字符可能并不是被ISO-8859-1或Windows-1252误读的UTF-8字节,序列可能不完整,或者替换字符已经造成信息丢失。请保留原文,并检查实际字节和编码元数据。

不能。它只比较粘贴的Unicode文本,不读取文件、不检测文件编码、不连接数据库、不改写存储值,也不修复服务器标头。执行字节级转换之前,请先备份原始数据。

不会。比较、选择候选结果、复制、创建TXT和准备打印都在浏览器中完成。漏斗模式可在此标签页中保留一条经过验证的记录,最长30分钟,URL中只会放入不透露内容的任务ID。

相关工具