先分清:这是词语,还是字形部件的排列



Unicode编码只能回答“复制到的是什么”,不能回答“原作者想表达什么”。即使三个字符分别能够在字典中找到读音或解释,组合后的排列仍然📚需要语境证明。古籍中的合文、异体、讹变和拆字说明,也不能仅凭现代字符序列自动还原。



字符规范化适合用于发现编码差异,但不适合替代原始证据。对于来源不明的罕见字,先保存原始字符串,再分别进行规范化前后的比对,可以避免兼容字符被转换后失去线索。



四种常见来源与对应判断方式



罕见字符串🎨的来源不同,判断方法也不同。识别来源时,页面排版和周边信息往往比字符本身更有价值。



字体显示异常也有可观察的信号。缺字通常表现为空白方框、替代符号或字形风格突然变化;OCR错误则▶️常伴随顺序错乱、重复字符和与上下文不通。两类情况都不能仅凭搜索次数少就解释为“失传古字”。



举报/反馈