广州日报
表情符号通常使用 Unicode 编码保存,其中不少表情需要多个字节表示。当文本保存时采用一种编码,读取时却💯使用了不匹配的编码,原本的表情字节就可能被转换成“馃”“悿”“☀️崙”等字符。
如果乱码出现在网站后台、商品标题或评论中,需要检查数据库字段、数据表和连接设置是否支持完整 Unicode。部分旧字符集只能保存常用中文,不能完整保存表情符号。此时即使前端页面设置正确,数据在写入数据库时也可能已经丢失。
更稳妥的做法是联系内容提供者,索取原始文本;或者查看未经过转换的网页源文件、数据库备份、聊天记录和编辑历史。如果只是用于宣传文案,也可以删除这两个乱码字符,保留后面的正常表达,避免读者误以为它是特殊词语或品牌名称。
网页、模板文件和文本编辑器应尽量统一使用 UTF-8。保存文件时不要反复在不同编码之间转换,否则表情可能在第一次转换后就已经损坏。网页内容、服务器输出、数据库连接和页面读取方式也要保持一致。
修复前应先备份数据,再确认新旧编码的转换方式。若原始表情已经被替换成“馃悿馃崙”,仅修改页面显示设置通常无法找回原图标,还需要从原始文章、聊天记录或备份中重新复制。
如果只有某一篇文章出现乱码,可以重新打开原始文件,确认编辑器识别的编码是否正确,再使用 UTF-8 格式重新保存。不要直接在乱码文本上反复转换,因为已经被错误解码的内容未必能够自动恢复。