乱码检查工具
此私密比较已无法使用
打开完整的单页工具粘贴看起来乱码的文本
粘贴类似café的文本,或因编码不匹配而无法阅读的日文字符串。编辑框中的原文会保持不变。
最多50,000个字符。本工具只比较粘贴的Unicode文本,不检查或修复文件、字节流、数据库或HTTP标头。
Mojibake,也就是乱码,是指字节被不兼容的字符集解码后,数据显示成错误字符的现象。常见示例是café:原文café以UTF-8编码,但它的字节却被当成Latin-1或Windows-1252解释。粘贴当前显示的文本,即可比较能够严格往返转换的还原假设。工具始终保留原文,把每个候选结果明确标为假设,并且只在浏览器本地完成比较。
如何比较乱码文本还原假设
-
1
粘贴当前显示的文本
按收到时的原样使用文本。本工具不会上传或检查源文件。
-
2
同意进行比较
让浏览器用严格的UTF-8解码器检验Latin-1和Windows-1252字节解释。
-
3
比较而不先下结论
将未更改的原文与每个可逆候选结果逐一比较,只在上下文支持时选择。
-
4
作为纯文本使用
复制、下载或打印所选假设,不会覆盖原文。
还原假设能说明什么,不能说明什么
字符编码规定字符与字节之间的对应关系。UTF-8用两个字节C3 A9表示é。如果软件将这两个字节按Windows-1252或ISO-8859-1解码,屏幕上可能出现é。一种有用的还原假设会反向处理这类特定错误:把当前显示的旧式字符视为字节值,严格按UTF-8解码这些字节,再确认将候选结果重新编码为UTF-8后能得到完全相同的字节。
往返检查会排除不完整或格式错误的UTF-8序列。包含替换字符�的候选结果也会被排除,因为该字符所替代的信息已经丢失。往返有效只能支持一种假设,不能证明源系统实际使用了哪种编码,也不能证明作者原本想表达什么。
| 当前显示的文本 | 检验的假设 | 可能的候选结果 | 需要核对的内容 |
|---|---|---|---|
café |
UTF-8字节被当作Latin-1读取 | café |
与原始来源核对拼写 |
It’s |
UTF-8字节被当作Windows-1252读取 | It’s |
检查标点和文档规范 |
æååã |
UTF-8字节被当作Latin-1读取 | 文字化け |
与可信的日文原文核对 |
café |
连续发生两次编码错误 | café |
检查两次受限转换 |
为什么日文文本需要上下文
日文UTF-8字节如果通过错误的旧式字符集解码,可能变成长串拉丁字母、符号和类似控制字符的内容。可逆性有助于缩小候选范围,但简短姓名或单独字符仍可能有多种解释。请将候选结果与原始文档、数据库导出的源记录、发送者提供的文本或其他权威副本核对。
工具限制与更安全的恢复方式
本工具接收的是浏览器已经解码为Unicode的文本。它无法找回此前被丢弃的字节,不能从二进制文件推断编码,不能修复数据库字段,也不能更改HTTP的Content-Type标头。如果没有候选结果,请保留原文。尽可能取得真正的源字节并创建备份,确认声明编码和实际编码,然后使用专门处理文件或字节流的工具正确解码一次。不要把损坏的文本反复覆盖到唯一的源副本上。
常见问题
不是。这只表示某一种旧式字节解释能够解码为有效UTF-8,并通过完全一致的字节往返检查。多种解释可能产生相同或不同但可读的文本,仍然需要结合上下文和权威来源判断。
当前字符可能并不是被ISO-8859-1或Windows-1252误读的UTF-8字节,序列可能不完整,或者替换字符已经造成信息丢失。请保留原文,并检查实际字节和编码元数据。
不能。它只比较粘贴的Unicode文本,不读取文件、不检测文件编码、不连接数据库、不改写存储值,也不修复服务器标头。执行字节级转换之前,请先备份原始数据。
不会。比较、选择候选结果、复制、创建TXT和准备打印都在浏览器中完成。漏斗模式可在此标签页中保留一条经过验证的记录,最长30分钟,URL中只会放入不透露内容的任务ID。
相关工具
单词打乱器
打乱每个单词中的字母,同时保留首尾字母。适合谜题、文字游戏和阅读练习。
AMA 引用生成器
为期刊论文、图书、网站和章节生成 AMA 格式参考文献,支持作者姓名首字母、DOI、URL 与访问日期的填写指引。
参考文献生成器
按 APA 7、MLA 9、Chicago 17 和 Harvard 生成格式正确的参考文献条目。支持书籍、期刊、网站、电影等。
奇幻名字生成器
按种族、职业和性别倾向生成奇幻角色名字,适合 D&D 战役、世界观设定、小说创作和 NPC 名单。
英语过渡词计数器
统计草稿中的18个英语过渡词和短语。查看总数、每个词项的次数,以及它们在全文词数中的密度。
IEEE 引用生成器
为期刊论文、会议论文、图书或网页生成一条 IEEE 格式的编号参考文献,支持 DOI、URL 和访问日期等字段。