澎湃新闻
“辶”在汉字结构中通常表示走之旁或走之底,常见于“这、过、近、送、道”等字的外围或下部。纯文本中的“辶”已经是一个单独的Unicode字符,后面紧跟“喿”时,显示结果只是两个字符相邻,并不等于一个已经编码的合体字。
与“喿”有关的常见字包括“噪”和“躁”,但这两个字的外部部件不同,不能写成“辶喿”。与“臿”有关的字形还可能出现在“插”等字中,识别时应区分“臿”这个部件和完整的“插”字。
如果原意是表达汉字的偏旁结构,原字符串缺🌟少明确的结构说明符,无法仅凭字符顺序确定目标字。若原意是查读音,应分别查询每个字符;若原意是识别图片或手写字,则需要结合原字形、上下文和字体,而不能把部件序列直接当成汉字。
部件拆分记录应把“实际汉字”和“结构描述”分开书写。实际汉字直接记录完整字符;无法确定单💯字时,可以写成“走之旁+喿部件”或“待确认的辶、喿结构”,这样比连续写“辶喿”更不容易被误认为现成汉字。
如果检索对象就是原始字符串,搜索时应保留每个字符并使用引号;如果检索对象是某个生僻汉字,📚应补充字形截图、出处或Unicode码点。只有同时确认字符序列、结构关系和语境,才能判断原文究竟是拆字标记、OCR错误,还是某个未被正确显示的单字。