北京日报
判断“人or猪or狗”最可靠的方式,不是观察文件名、样本名称或单条基因,而是对📢经过质控的测序数据分别比对到人、猪、狗的同版本参考基因组,再结合唯一比对比例、覆🚀盖范围、线粒体与核基因组信号、污染情况共同判断。DNA数据下载则应先确认样本或参考基因组的 accession、文件类型、基因组版本和校验值,再下载并验证文件完整性。
人or猪or狗的物种判定必须建立在可用读段之上,低质量碱基、接头残留和过短序列会明显增加错误匹配。短读段分析可以先检查每个样本的总读段数、平均质量、N碱基比例、接头污染和重复率,再决定是否进行剪切。
实际处理时,建议按照“明确数据类型—核对元数据—下🔮载原始文件—校验压缩包—质量控制—物种分类—候选参考比对”的顺序操作。只有一份短序列时可以先使用线粒体标记或保守基因进行初筛;拥有全基因组或全外显子测序数据时,应优先采用核基因组证据,避免把污染、样本混合或错误注释误判成物种差异。
人类测序数据还需要额外检查访问权限。公开数据可以直接下载,受控访问数据则必须按照数据仓库的授权要求获取,不能通过改文件名、复制他人凭证或绕过权限取得个人基因组信息。