光明日报
DNA样本数据和参考基因组承担的任务不同,下载前必须先区分两者。样本数据通常来自测序项目,常见文件是FAS👍TQ,里面保存实际测得的读段及质量值;参考基因组通常☀️是FASTA,里面保存经过组装的染色体或 contig 序列,常配套GFF、GTF、索引和染色体长度文件。
人类测序数据还需要额外检查访问权限。公开数据可以直接下载🎯,受控访问数据则必须按照数据仓库的授权要求获取,不能通过改文件名、复制他人凭证或绕过权限取得个人基因组信息。
短序列的物种判断需要考虑片段长度和保守程🎉度。保守基因的一小段序列可能同时匹配多个哺乳动物,💯只有包含足够特异位点、且正反向比对结果一致时,结论才更可信。
人or猪or狗的物种判定必须建立在可用读段之上,低质量碱基、接头残留和过短序列会明显增加错误匹配。短读段分析可以先检查每🔮个样本的总🎆读段数、平均质量、N碱基比例、接头污染和重复率,再决定是否进行剪切。
质控工具的输出应保存为独立🎆报告。fastp、FastQC等工具可以帮助发现质量问题,但它们只能说明序列是否适合分析,不能直接回答样本来自人、猪还是狗。
物种报告不宜只写“是人”“是猪”或“是狗”。更稳妥的写法是同时给出参考版本、过滤条件、分类方法、主要比对🌺比例、覆盖范围以及是否发现混合信号;当证据不足时,应写成“与某物种最💫相符”或“无法排除混合来源”,而不是强行给出确定结论。