中国青年报
“馃崋馃崙”这类连续出现相似字符的内容,常见原因是字符编码不一致,而不是原作者真的输入了这组汉字。文字在计算机中会先转换为字节,再按照某种编码方式显示;如果保存时使用一种编码、读取时使用另一种编📌码,表情符号、少数民族文🎊字、数学符号和其他非基本汉字就容易变成看似中文的陌生字符。
历史数据已经出现乱码时,应先判断数据库里保存的是正确字符还是错误解码后的结果。如果数据库中仍保留原始字节,可以通过正确编码重新读取;如果错误字符已经被保存并覆盖原值,只能从备份、日志、缓存、发送端或原始文件中恢复,程序无法凭空确定唯一答案。
程序系统中的乱码恢复,关键不是寻找一个看起来相似的替换字,而是让存储、传输和显示三个环节使用一致的字符编码。数据库中的字段字符集、连接字符集、接口声明和页面输出只要有一环不一致,特殊字符就可能在保存或读取时发生损坏。