论文
后训练 如何塑造生物推理模型
How Post-Training Shapes Biological Reasoning Models
摘要
生物学科学推理模型将语言模型与基于多模态生物数据(包括 DNA、RNA 和蛋白质)训练的基础模型相结合。这些模型是通过 后训练 构建的,但每个阶段如何形成推理和泛化仍然知之甚少。我们研究 后训练 何时提高性能以及何时导致过度专业化。在基因组学、转录组学和蛋白质领域,我们在主干受控变化、持续 预训练 (CPT)、监督 微调 (SFT) 和强化学习 (RL) 下训练和评估 100 多个生物推理模型,测量域内 (ID) 和域外 (OOD) 性能。我们发现每个 后训练 阶段都以不同的方式重塑泛化,而不是贡献统一的增益。 CPT 通过使模型与生物语言保持一致来提高下游性能。 SFT 持续提高 ID 性能,但会导致 OOD 性能提早达到峰值,并随着模型拟合训练分布而下降。当 RL 应用于具有一致奖励的强大 SFT 检查点时,可以提高 OOD 性能并部分恢复泛化能力。这些结果表明,生物推理不会随着额外的监督或计算而单调改进。相反,性能取决于训练阶段的组成方式。在固定的 后训练 预算下,最强的 ID-OOD 权衡来自于简短的 SFT、更大的 RL 分配和跨阶段的不对称适应能力。