新京报
判断“人or猪or狗”最可靠的方式,不是观察文件名、样本名称或单条基因,而是对经过质控的测序数据分别比对到人、猪、狗的同版本参考基因组,再结合唯一比对比例、覆盖范围、线粒体与核基因组信号、污染情况共同判断。DNA数据下载则应先确认样本或参考基因组的 accession、文件类型、基因组版本和校验值,再下载并验证文件完整性。
核基因组比对结果应重点看覆盖是否遍布多个染🌅色体,而不是只看命🎇中读段总数。一个候选物种如果只有线粒体区域出现高深度,而核基因组覆盖很低,可能是线粒体污染、样本混合或环境DNA,不应直接报告为纯样本。
压缩格式不能替代完整性验证。文件能够解压,只👍说明压缩结构基本可读,不能证明文件从头到尾没有缺失;校验值一致、读段数量合理、配对关系正确,才构成可用的下载结果。
人类测序数据还需要额外检查访问权限。公开数据可以直接下载,受控访问数据则必须按✨照数据仓库的授权要求获取,不能通过改文件名、复制他人凭证或绕过权限取得个人基因组信息。
人or猪or狗的正式判断应同时比较三个候选参考基因组,而不是只把数据比对到其中一个物种。把读段分别比对到人、猪、狗参考序列后,需要比较高质量唯一比对读段的比例、覆盖的染色体范围、平均覆盖深度、比对质量值和错配分布。
k-mer分类结果适合做快速筛查。Kraken类工具、Centrifuge类工具或基于Mash的相似性分析可以先给出候选物种,但分类数据库的构建版本会改变结果,因此必须记录数据库来源、版本和过滤🎵参数,并用独立比对复核。
物种报告不宜只写“是人”“是猪”或“是狗”。🎨更稳妥的写法是同时给出参考版本、过滤条件、分类方法、主要比对比例、覆盖范围以及是否发现混合信号;当证据不足时,应写成“与某物种最相符”或“无法排除混合来源”,而不是强行给出确定结论。