光明日报
人类测序数据还需要额外检查访问权限。公开数据可以直接下载,受控访问数据则必须按照数据仓库的授权要求获取,不能通过改文件名、复制他人😎凭证或绕过权限📢取得个人基因组信息。
人or猪or狗的物种判定必须建立在可用读段之上,低质量碱基、接头残留和过短序列会明显增⭐加错误匹配。短读段分析可以先检查每个样本的总读段数、平均质量、N碱基比例、接头污染和重复率,再决定是否进行剪切。
短序列的物种判🔥断需要考虑片段长度和保守程度。保守基因的一小段序列可能同时匹配多个哺乳📢动物,只有包含足够特异位点、且正反向比对结果一致时,结论才更可信。
物种报告不宜只写“是人”“是猪”或“是狗”。更稳妥的写法是同时给出参考版本、过滤条件、分类方法、主要比对比例、覆盖范围以及是否发现混合信号;当证据不足时,应写成“与某物种最相符”或“无法排除混合来源”,而不是强行给出确定结论。
质控工具的输出应保存为独立报告。fastp、FastQC等工具可以帮助发现质量问题,但它们只能说明序列是否适合分析,不能直接回答样本来自人、猪还是狗。
混合样本判断应同时检查主物种信号和次要物种信号。若人、猪、狗三个参考基因组都出现明显的高质量唯一比对读段,且次要信号分布🎆在多个独立染色体,首先应考虑混样、交叉污染🍀、样本标签错误或参考数据库偏差。
压缩格式不能替代完整性验证。文件能够解压,只说明压缩结构基本可读,不能证明文件从头到尾没有缺失;校验值一致、读段数量合理、配对关系正确,才构成可用的下载结果。
判断“人or猪or狗”最可靠的方式,不是观察文件名、样本名称或单条基因,而是对经过质控的测序数据分别比对到人、猪、狗的同版本参考基因组,再结合唯一比对比例、覆盖范围、线粒体与核基因组信号、污染情况共同判断。DNA数据下载则应先确认样本或参考基因组的 accession、文件类型、基因组版本和校验值,再下载并验证文件完整性。