论文

熵、分歧和基因组学基础模型的局限性

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

模型评测模型行为与机制分析

摘要

与自然语言处理领域的对应模型相比,基因组学领域的基础模型取得了不同程度的成功。然而,其有效性有限的原因仍然知之甚少。在这项工作中,我们研究了熵作为限制此类模型从训练数据中学习和发展基础能力的能力的基本因素的作用。我们在文本和 DNA 序列上训练模型集合,并分析它们的预测、静态嵌入和经验费希尔信息流。我们表明,从看不见的标记预测的角度来看,基因组序列的高熵会导致接近均匀的输出分布、模型之间的不一致以及不稳定的静态嵌入,即使对于在架构、训练和数据方面匹配的模型也是如此。然后我们证明,在 DNA 上训练的模型将 Fisher 信息集中在嵌入层中,似乎未能利用词元间的关系。我们的结果表明,仅从序列进行自我监督训练可能不适用于基因组数据,这使人们对当前训练基因组基础模型的方法的假设产生了疑问。