论文
通过动态模型插值实现系统1与系统2协同
System 1&2 Synergy via Dynamic Model Interpolation
摘要
训练一个能在直觉的系统1与深思的系统2之间自适应的统一语言模型仍具挑战性,原因在于两种认知模式之间的干扰。近期研究因此追求让系统2模型更高效。然而,这些方法聚焦于输出控制,限制模型产出的内容。我们认为这一范式错位:输出长度只是模型认知配置的症状,而非根本原因。在这项工作中,我们将焦点转向能力控制,它调节模型如何思考而非产出什么。为此,我们利用现有的Instruct和Thinking检查点进行动态参数插值,无需额外训练。我们的先导研究确立线性插值产生凸的、单调的帕累托前沿,其背后是表示连续性和结构连通性。在此基础上,我们提出DAMI(Dynamic Model Interpolation)框架,估计查询特定的推理强度λ(q)来配置认知深度。对于基于训练的估计,我们开发了一种编码准确率与效率标准的偏好学习方法。对于零样本部署,我们引入一种利用模型间认知差异的基于置信度的方法。在五个数学推理基准上的实验表明,DAMI在保持高效的同时取得高于Thinking模型的准确率,有效结合了系统1的效率与系统2的推理深度。
