论文
TMAS:通过多智能体协同扩展测试时计算
TMAS: Scaling Test-Time Compute via Multi-Agent Synergy
摘要
测试时扩展已成为一种有效范式,通过在推理期间分配额外计算来提升大语言模型的推理能力。近期的结构化方法通过在多条轨迹、多轮精炼和基于验证的反馈之间组织推理,进一步推进了这一范式。然而,现有结构化测试时扩展方法要么对并行推理轨迹的协调较弱,要么依赖带噪声的历史信息而未显式决定应保留和复用什么,限制了其在探索与利用之间取得平衡的能力。在本工作中,我们提出TMAS,一个通过多智能体协同扩展测试时计算的框架。TMAS将推理组织为专业化智能体之间的协作过程,实现跨智能体、跨轨迹和跨精炼迭代的结构化信息流。为支持有效的跨轨迹协作,TMAS引入分层记忆:经验库复用底层可靠的中间结论与局部反馈,而准则库记录此前探索过的高层策略,引导后续rollout避开冗余的推理模式。此外,我们设计了面向TMAS的混合奖励强化学习方案,共同保持基础推理能力、提升经验利用率,并鼓励探索此前未尝试过的解题策略。在高难度推理基准上的大量实验表明,TMAS比现有测试时扩展基线实现了更强的迭代扩展,混合奖励训练进一步提升了跨迭代扩展的有效性与稳定性。代码与数据见 https://github.com/IQuestLab/tmas。
