日期解析时应设置明确格式。例如,系统确认14may18表示2018年5月14日后,再转换成标准格式2018-05-14;如果🎊系统只确认存在日期片段但无法确认顺序,则应保留原文,并把解析状态标记为待确认。
批量导入时还要防止大小写、空格和特殊字符造成重复。GB14may18_XXXXXL实例与gb14may18_xxxxxl实例可能只是展示格式不同,也可能代表两个不同的系统值。除非业务规则明确规定大小写不敏感,否则不应直接合并。
自动化脚本应先执行格式检查,再执行业务校验。格式检查可以确认是否存在下划线、字符长度是否合理;业务校验则需要检查前缀是否属于已知集合💫、日期是否真实存在、后缀是否与相关属性一致。两类检查不能互相替代。
数据库字段场景中的GB14may18_XXXXXL实例需要先区分“业务值”和“技术主键”。业务值通常可以被用户理解,技术主键则可能只要求唯一,不保证可读。若该字符串位于id、key、trace_id或file_code字段中,不能因为字符结构明显就擅自修改。
陌生编码的核验应当按照“定位来源、💡确认字段、寻找样本、验证规则、记录结论”的顺序推进。这个流程适合文件、表格、接口和日志,不需要一开始就编写复杂脚本。
数据清洗时应保留原始字段和解析字段。原始值可以命名为raw_code,拆解后的前缀、日期、后缀可以分别保存为source_code、code_date、code_suffi📌x。这样的设计便于回溯,也能避免清洗规则改变后无法恢🍀复原始记录。