UTF-8转换

UTF-8 编码汉字互转
工具简介

UTF-8 编码转换工具支持 Unicode 与各种字符编码(UTF-8、UTF-16、UTF-32、GBK、GB2312、GB18030、Big5、BIG5-HKSCS、EUC-JP、Shift_JIS、EUC-KR、ISO-8859-1 等)互转。可处理字符串级别和文件级别的批量编码转换,支持「智能识别」自动匹配原编码(基于统计学字符频率分析)。高级功能涵盖 BOM 处理(添加/去除 UTF-8 BOM)、错误处理策略(忽略/替换/抛错)、行尾符转换(LF/CRLF/CR)、空字节转换。使用场景:修复乱码 .csv 文件、字幕文件转换(srt/ssa)、老 .asp/.jsp 项目迁移、Doxygen 注释字符集修复、压缩包中文文件名解密等。完全在浏览器本地运算,数据不上传。

使用步骤
1
选择转换模式
顶部选择「字符串转换」「文件转换」模式,字符串模式直接粘贴文本,文件模式上传 .txt/.csv/.srt 等。
2
选择编码
源编码选择(自动/UTF-8/GBK/GB18030/BIG5 等),目标编码通常选 UTF-8,设置错误处理策略。
3
查看结果
点「转换」按钮 1 秒内返回结果,提供对比预览(原编码 vs 新编码),点击「下载」保存为新文件。
常见问题
中文文件乱码怎么处理?

常见原因是用 GBK 编码保存却被 UTF-8 工具读取。本工具的「智能识别」会自动检测编码可能性,概率高的 GB18030/EUC-CN/UTF-8 同时列出。也可直接试 Big5(繁体)和 GB18030(简体)。

UTF-8 编码怎么去掉 BOM?

BOM 是文件开头的 0xEF 0xBB 0xBF 三字节,某些 Linux 工具/脚本不识别。在「选项」中勾选「去除 BOM」即可输出纯净 UTF-8。本工具默认显示 BOM 检测结果。

「替换错误」和「抛错」策略怎么选?

默认「替换」会把无法识别的字节替换成 ?,适合快速查看大致内容。「抛错」会在遇到错误时中断并报告位置,适合自动化脚本快速定位损坏字节。「忽略」则跳过错误字节,适合编码不重要的标签属性。

Big5 和 GB18030 怎么区分?

Big5 是繁体中文(台湾、香港),GB18030 是简体/繁体兼容中文(中国大陆)。两者不重叠区段很少,但高频字「的」「是」「我」不同。本工具基于字符频率统计给「最可能编码」的概率排序,适合批量转码。