论文

TRACER:面向协作式多LLM推理的带内部强化信用的轮级遗憾匹配

TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning

智能体系统模型训练强化学习Agent 协作RLVR

摘要

大语言模型日益依赖强化学习或多智能体提示来提升推理能力,但这两种范式仍然难以结合。将单智能体强化学习直接应用于多轮多智能体系统面临如下困境:i) 奖励稀疏、角色层面的搭便车和过高的训练开销。ii) 智能体只是通过模仿来协作。iii) 固定的协作协议会陷入震荡的局部最优。我们提出TRACER,一个面向协作式多LLM推理的轮级强化框架。TRACER将协作决策分为控制器—遗憾层和生成—信用层:前者中控制器通过遗憾匹配学习智能体应当发言还是跳过当前轮,后者用角色专属的GSPO奖励优化提议者与审阅者的话语。这一设计 i) 在动作模式与生成话语两个层面同时分配信用,从而避免搭便车与奖励稀疏。我们只扩展控制器所做的选择,从而大幅降低训练的计算成本。此外,ii) 智能体在学习何时发言、说些什么的过程中习得协作能力。最后,iii) 通过巧妙设计二元动作,我们将为有限动作空间建立的经典博弈论扩展到深度学习,从而实现数学上严格的收敛。我们在GSM8K训练划分上训练所有本地RL风格方法,并在留出的GSM8K、MATH500与GPQA-Diamond上评估域内准确率、跨基准泛化、推理成本与纠错保持行为。所得框架为研究超越固定辩论、投票或聚合协议的可学习协作策略提供了一个紧凑且可复现的试验台。代码发布于 https://github.com/Shark-Forest/TRACER。

TRACER:面向协作式多LLM推理的带内部强化信用的轮级遗憾匹配:论文配图
图 1:TRACER 与基于 Qwen2.5-7B-Instruct 的非 RL 和 RL 基线的雷达在准确性和效率指标上的比较。 GSM8K、MATH500 和 GPQA-D 是准确性指标,其中值越大越好,而令牌/任务、LLM 调用/任务和代理/任务是成本指标,其中值越小越好,因此反转以进行可视化。所有轴均已标准化,因此距离中心越远的点表示性能越好。空心红色圆圈标记基线方法的薄弱维度,突出显示竞争方法导致准确性下降或推理成本更高的地方。 TRACER 在各个任务之间保持更加平衡的配置,即保持重要的推理准确性并实现多代理效率。