论文
TaxDistill:通过蒸馏基因组基础模型改进宏基因组分类注释
TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models
摘要
宏基因组分类注释对于解释复杂的微生物群落至关重要,但在参考数据库不完整和分类边界模糊的情况下,可靠的注释仍然具有挑战性。现有的基于相似性的工具是有效的,但它们经常在复杂的环境中产生嘈杂的伪标签;当基于上游分类器生成的硬伪标签进行训练时,基于学习的事后校正方法可以进一步继承这种噪声。我们提出 TaxDistill,这是一种即插即用的 知识蒸馏 框架,用于可靠的宏基因组分类重新校准。 TaxDistill 使用基因组基础模型 GenomeOcean 作为语义教师,并执行单向在线 蒸馏,其中教师通过分层分类监督进行更新,而其独立的软概率分布指导轻量级学生网络。这种设计减轻了学生对嘈杂的硬伪标签的过度拟合,并支持基于置信度的拒绝潜在不可靠的预测。使用 MMseqs2、Metabuli 和 Kraken2 对七个不同的 CAMI2 数据集进行的综合实验表明,TaxDistill 在大多数情况下比现有基线提高了注释可靠性。例如,在 Gastrointestinal 数据集上,TaxDistill 将 MMseqs2 的 F1 分数从 0.763 提高到 0.941,超过了 Taxometer 基线。我们的结果表明,大型基因组基础模型可以为嘈杂的科学注释提供语义监督,从而能够对现有宏基因组注释结果进行轻量级事后重新校准。