“字形”和“字符组合”不能混为一谈



在通常的 Unicode 文本中,第一组和第二组都是多个独立字符的顺序排列。常见字符信息如下:



这些字符串可能是怎样产生的



就当前显示的文字而言,“辶喿辶喿辶臿”和“辶喿辶念”都不是一个完整汉字的字形,而是由多个汉字或部件字符连续组成的字符串。前者可以拆成“辶、喿、辶、喿、辶🌈、臿”,后者可以拆成“辶、喿、🔥辶、念”。因此,不能直接把它们判断为同一个汉字的异体字、繁简字或两种字体写法。



两者的共同部分是开头的“辶喿辶”,之后分别接有“喿辶臿”和“🎇念”。如果原始资料中显示的是一📢个完整的复杂汉字,那么当前文本很可能是部件拆分、识别错误、复制异常,或者缺少表示部件组合关系的编码信息。



而“辶喿辶喿辶臿”这种写法,文本层面已经包含多个独立字符。浏览器只是按照从左到右的顺序把它们显示出来,并不会自动把它们拼成一个新的汉字。即使这些字符在视觉上像某个字的部件,也不🤔能据此确定它们之间是上下、左右、包围🎯还是嵌套关系。



举报/反馈