新华社
乱码通常发生在文字写入、读取或传输时使用了不一致的字符编码。中文网页、数据库和程序接口常见的编码包括 UTF-8、GBK、GB2312、Big5 等;当一段 UTF-8 内容被错误地按照其他编码读取时,原本的中文或表情符号就可能变成无法理解的字符。
乱码还可能由表情符号造成。部分系统将四字节 Unicode 字符处理不完整,便会出现以“馃”开头或包含异常汉字的结果。社交平台、旧版数据库、文本编辑器和跨系统导出文件,都可能放大这种问题。
网站内容发布应在数据进入页面之前统一字符集。新建页面、数据库字段、接口响应和导出文件最好采用一致的 Unicode 编码,并在开发、测试、生产环境中分别验证中文与表情符号。