论文

MADA-RL:紧凑模型中参数高效推理的多智能体辩论感知强化学习

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

模型训练强化学习

摘要

大语言模型 实现了强大的推理性能,但通常训练成本过高 - 对于在有限预算下训练的紧凑模型($\leq 4 \,\mathrm{B}$ 参数)来说,这一挑战尤其严峻。我们引入了 MADA-RL,这是一个 后训练 框架,专门针对生成器和评论家角色的紧凑模型,并使用辩论感知学习信号对其进行训练,微调 仅通过 LoRA 适配器的一小部分参数。我们的核心贡献是反事实批评家优势:一个动态的、角色条件化的基线,它将批评家的优势重新定义为其奖励减去生成器集成的每个实例的准确性。这明确地优化了批评者以改进生成器共识,而不是仅仅重现正确答案,从而产生比静态平均奖励标准化更有针对性的信用分配。在部署时,专用代理由轻量级多轮协议组成。在五个数学推理基准中,MADA-RL 将 DeepSeek-R1-Distill-Qwen-1.5B 模型的准确性从 $39.9 \, \%$ 提高到 $41.9 \, \%$ ($+2.0$ 点,$p < 0.001$),使用的可训练参数比完全微调的基线少 16$ 倍,将其置于准确性可训练参数 Pareto 前沿。它接近但没有超越最强的基线(DeepScaleR、STILL-3),这些基线是在更大的数据集上进行训练的;我们直接分析这个差距和相关的推理时间成本。一项对照研究隔离了 MADA-RL 收益的来源:反事实优势产生了所有评估模型中最高的批评者改进率,这表明训练有素的批评者学会纠正生成器错误而不是模仿它们。