为什么会出现乱码?
文字保存时会被转换成字节,这套规则叫作“编码”。中文除了 UTF-8,还长期使用 GBK(Windows 简体中文的默认编码)和 GB18030。如果用不同于保存时的编码去读取,字节就会被显示成别的字,这就是乱码。
常见的乱码类型
浣犲ソ锛屼笘鐣:UTF-8 的内容被当作 GBK 读取。用 Excel 双击打开 CSV 时最常见。ÄãºÃ£¬ÊÀ½ç:GBK 的内容在西文系统(Windows-1252)上显示。常见于海外邮件和网站。锟斤拷:乱码被再次保存后的结果。原来的文字已经丢失,只能从原始文件恢复。
Mojibuster 会自动判断属于哪种类型,把文字还原成原来的字节,再用正确的编码重新读取。本来就正确的文字不会被改动。
所有处理都在浏览器中完成。文本和文件不会上传,也不会被保存在任何地方。
常见乱码示例
| 乱码 | 原文 |
|---|---|
| 浣犲ソ | 你好 |
| 涓枃 | 中文 |
| 涔辩爜 | 乱码 |
| 鏂囦欢 | 文件 |
| 鐢佃瘽 | 电话 |
| 鍦板潃 | 地址 |
| 濮撳悕 | 姓名 |
| 鍖椾含 | 北京 |
| 鏁版嵁 | 数据 |
| 缂栫爜 | 编码 |
| 瀛楀箷 | 字幕 |
| 琛ㄦ牸 | 表格 |
常见问题
什么是乱码?
用与保存时不同的编码读取文字,结果显示成一堆看不懂的字符,这就是乱码。日语叫“文字化け”,英语也叫 mojibake。
文件会被上传吗?
不会。Mojibuster 完全在浏览器中运行,文本和文件不会离开你的设备,也不会被保存。
“锟斤拷”能恢复吗?
不能。“锟斤拷”说明原来的字节已经被替换掉了。Mojibuster 会把它显示为 � 并告诉你丢失了多少个字符,请尽量找到原始文件。
支持哪些文件?
CSV、TXT、JSON、XML、字幕(SRT、VTT)、Markdown、HTML、SQL、日志等文本文件,最大 100 MB。
要收费吗?
不收费。Mojibuster 免费使用,也不需要注册。