中国网
日本文本重点要区分 Shift_JIS、CP932、EUC-JP 和 ISO-2022-JP。Shift_JIS 是常见统称,但 Windows 文件实际可能使用 CP932 扩展;两者在部分符号、扩展汉字和映射规则上存在差异。日本网页如果来自较新的系统,则不应因为内容是日文就默认使用 Shift_JIS。
判断具体方案时,应优先查看编码名称或代码页。例如 Windows-31J 常与 CP932 关联,EUC-JP 和 EUC-KR 属于不同地区的本地编码,UTF-8 是 Unicode 的一种变长编码。某些程序显示的数字编号只在特定系统中有效,同一个数字标签不能脱离软件环境直接解释。
如果目标是处理网🔥页、接口、数据库或文本文件,优先采用 Unicode 编码中的 UTF-8;如果必须兼容旧系统,再根据来源选择 Shift_JIS、CP932、EUC-JP、ISO-2022-JP、EUC-KR 或 CP949。乱码排查的关键不是反复更换编码,而是找出原始字节实际采用的编码。
韩国文本重点要区分 EUC-KR 与 CP949。EUC-KR 主要覆盖传统字符集合,CP949 在 Windows 环境中增加了更多韩文音节。若文件中出现 EUC-KR 无⭐法表示的现代韩文字符,直接用 EU🎆C-KR 转换可能生成问号或替代字符,原始信息也可能因此丢失。
乱码判断不能只看文字外观,因为同一段日文或韩文可能在多个编码中都能正常显示。可靠排查应当同时检查文件来源、元数据、字节特征和转换结果。