上海发布
k-mer分类结果适合做快速筛查。Kraken类工具、Centrifuge类工具或基于Mash的相似性分✅析可以先给出候选物种,但分类数据库的构建🎉版本会改变结果,因此必须记录数据库来源、版本和过滤参数,并用独立比对复核。
质控工具的输✨出应保存为独立报告。fastp、FastQC等工具可以帮助发现质量问题,但它们只能说明序列是否适合分析,不🔮能直接回答样本来自人、猪还是狗。
核基因组比对结果应重点看覆盖是否遍布多个🎵染色体,而不是只看命中读段总数。一个候选物种如果只有线粒体区域出现高深度,而核基因组覆盖很低,可能是线粒体污染、样本混合或环境DNA,不应直接报告为纯样本。
实际处理时,建议按照“明确数据类型—核对元数据—下载原始文件—校验压缩包—质量控制—物种分类—候选参考比对”的顺序操作。只有一份短序列时可以先使用线粒体标记或保守基因进行初筛;拥有全基因组或全外显子测序数据时,应优先采用核基因组证据,避免把污染、样本混合或错误注释误判成物种差异。
压缩格式不能替代完整性验证。文件能够解压,只说明压缩结构基本可读,不能证明文件从头到尾没有缺失;校验值一致、读段数量合理、配对关系正确,才构成可用的下载结果。