论文
TRACER:面向协作式多LLM推理的带内部强化信用的轮级遗憾匹配
TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning
摘要
大语言模型日益依赖强化学习或多智能体提示来提升推理能力,但这两种范式仍然难以结合。将单智能体强化学习直接应用于多轮多智能体系统面临如下困境:i) 奖励稀疏、角色层面的搭便车和过高的训练开销。ii) 智能体只是通过模仿来协作。iii) 固定的协作协议会陷入震荡的局部最优。我们提出TRACER,一个面向协作式多LLM推理的轮级强化框架。TRACER将协作决策分为控制器—遗憾层和生成—信用层:前者中控制器通过遗憾匹配学习智能体应当发言还是跳过当前轮,后者用角色专属的GSPO奖励优化提议者与审阅者的话语。这一设计 i) 在动作模式与生成话语两个层面同时分配信用,从而避免搭便车与奖励稀疏。我们只扩展控制器所做的选择,从而大幅降低训练的计算成本。此外,ii) 智能体在学习何时发言、说些什么的过程中习得协作能力。最后,iii) 通过巧妙设计二元动作,我们将为有限动作空间建立的经典博弈论扩展到深度学习,从而实现数学上严格的收敛。我们在GSM8K训练划分上训练所有本地RL风格方法,并在留出的GSM8K、MATH500与GPQA-Diamond上评估域内准确率、跨基准泛化、推理成本与纠错保持行为。所得框架为研究超越固定辩论、投票或聚合协议的可学习协作策略提供了一个紧凑且可复现的试验台。代码发布于 https://github.com/Shark-Forest/TRACER。
