论文
CORE:经由交叉教学的协作推理
CORE: Collaborative Reasoning via Cross Teaching
摘要
大语言模型展现出互补的推理错误:在同一实例上,一个模型可能以某种分解成功,而另一个失败。我们提出协作推理(CORE),一个训练时协作框架,通过交叉教学协议将同伴成功转化为学习信号。每个问题分两个阶段求解:先是一轮独立采样的冷启动轮,随后是带上下文的救援轮,其中失败的模型会收到从成功同伴中提取的提示。CORE优化一个组合奖励,平衡(i)正确性、(ii)受DPP启发的轻量多样性项以减少错误重叠,以及(iii)针对成功挽救的显式救援奖励。我们在四个标准推理数据集GSM8K、MATH、AIME和GPQA上评估CORE。仅用1,000个训练样本,一对小型开源模型(3B+4B)在GSM8K上达到Pass@2 99.54%,在MATH上达到92.08%,而单模型训练分别为82.50%和74.82%。在更难的数据集上,3B+4B组合在GPQA上达到Pass@2 77.34%(348个样本训练),在AIME上达到79.65%(792个样本训练),训练时预算最多1,536个上下文token和3,072个生成token。总体而言,这些结果表明训练时协作可以在不扩大模型规模的情况下可靠地将模型互补性转化为大幅收益。
