论文

弱驱动学习:弱智能体如何让强智能体更强

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

模型训练监督微调与指令调优

摘要

随着后训练优化成为提升大语言模型的核心手段,我们观察到一个持续存在的饱和瓶颈:一旦模型变得高度自信,继续训练的收益就会递减。现有方法仍在继续强化目标预测,而我们发现有信息量的监督信号潜藏于模型自身历史上的弱状态之中。受此观察启发,我们提出 WMSS(Weak Agents Can Make Strong Agents Stronger),一种利用弱检查点来引导持续优化的后训练范式。WMSS 通过熵动态识别可恢复的学习缺口,并通过补偿性学习对其加以强化,使强智能体能够超越常规后训练的饱和点继续提升。在数学推理与代码生成数据集上的实验表明,用我们的方法训练的智能体取得了有效的性能提升,且不产生任何额外的推理成本。

弱驱动学习:弱智能体如何让强智能体更强
图2:弱驱动学习(Weak-Driven Learning)。WMSS概览。该框架包含三个阶段:(1) 初始化,(2) 通过课程学习激活SFT数据,(3) 联合训练弱模型与强模型以获得更强的模型;右侧面板通过logit混合与梯度放大可视化了联合训练的原理。