生物推理模型何时使用其生物输入?
When Do Biological Reasoning Models Use Their Biological Inputs?
摘要
生物推理模型使用后训练将大语言模型与生物基础模型表示和生物文本连接起来。他们的基准准确性被视为大语言模型对这些输入进行推理的证据。我们在 DNA、蛋白质和单细胞任务的六个生物推理模型中测试了这一假设。我们扰乱一个生物输入,同时保持查询和其他输入固定,构建证据冲突,将一个基因组、蛋白质或细胞的基础模型表示与另一个基因组、蛋白质或细胞的文本配对,将线性探针拟合到语言模型接收的表示,并根据生物输入分析推理痕迹。 Evo2 和 ESM3 对 BioReason 和 BioReason-Pro 在评估任务中的表现贡献不大。 DNA 序列的改组几乎不会改变 BioReason 疾病预测的准确性,而且有证据表明,两种模型在 97.9% 和 99.7% 的情况下遵循文本存在冲突。在 Evo2 和 ESM3 表示上训练的线性探针可以预测任务目标,因此这些基础模型编码与任务相关的信息,但对 BioReason 和 BioReason-Pro 的整体性能改进有限。相比之下,基础模型输入有助于 ChatNT、Prot2Text-V2 和 CellWhisperer 的性能,而基因句子中差异表达的基因有助于 Cell2Sentence-Scale 的性能。在 BioReason-Pro 的 SFT 和 RL 检查点以及 42 个 BioReason 检查点中,准确性的提高并不意味着生物输入对性能贡献更大。 BioReason 追踪错误状态的核苷酸变化,而 BioReason-Pro 追踪描述证据冲突下最终预测中遗漏的功能。我们发现当前的后训练策略并不能确保基础模型表示有助于任务性能。