论文
经多智能体强化学习的思维链自压缩
Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
摘要
冗余推理引发的推理开销损害交互体验,严重制约大型推理模型的部署。现有基于强化学习(RL)的方案通过把长度惩罚与基于结果的奖励耦合来应对这一问题。这种简单的奖励加权难以兼顾简洁与准确,因为强制简洁可能损害关键推理逻辑。在本工作中,我们通过提出一个多智能体RL框架来应对这一局限,该框架选择性惩罚冗余分块,同时保留核心推理逻辑。我们的框架Self-Compression via MARL(SCMA)通过两个专门智能体实例化冗余检测与评估:负责把推理过程分解为逻辑分块的分割智能体(Segmentation Agent),以及量化每个分块重要性的评分智能体(Scoring Agent)。分割与评分智能体在训练中协同定义重要性加权的长度惩罚,激励推理智能体(Reasoning Agent)优先保留核心逻辑,且不在部署时引入推理开销。跨模型规模的实证评估表明,SCMA将响应长度缩短11.1%至39.0%,同时把准确率提升4.33%至10.02%。消融研究与定性分析进一步验证,MARL框架内的协同优化催生涌现行为,产出比原生RL范式更强大的LRM。
