论文

TMAS:通过多智能体协同扩展测试时计算

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

测试时扩展已成为一种有效范式,通过在推理期间分配额外计算来提升大语言模型的推理能力。近期的结构化方法通过在多条轨迹、多轮精炼和基于验证的反馈之间组织推理,进一步推进了这一范式。然而,现有结构化测试时扩展方法要么对并行推理轨迹的协调较弱,要么依赖带噪声的历史信息而未显式决定应保留和复用什么,限制了其在探索与利用之间取得平衡的能力。在本工作中,我们提出TMAS,一个通过多智能体协同扩展测试时计算的框架。TMAS将推理组织为专业化智能体之间的协作过程,实现跨智能体、跨轨迹和跨精炼迭代的结构化信息流。为支持有效的跨轨迹协作,TMAS引入分层记忆:经验库复用底层可靠的中间结论与局部反馈,而准则库记录此前探索过的高层策略,引导后续rollout避开冗余的推理模式。此外,我们设计了面向TMAS的混合奖励强化学习方案,共同保持基础推理能力、提升经验利用率,并鼓励探索此前未尝试过的解题策略。在高难度推理基准上的大量实验表明,TMAS比现有测试时扩展基线实现了更强的迭代扩展,混合奖励训练进一步提升了跨迭代扩展的有效性与稳定性。代码与数据见 https://github.com/IQuestLab/tmas。

TMAS:通过多智能体协同扩展测试时计算
图 1:TMAS 框架概述。对于每个问题,TMAS 并行生成多个解决方案轨迹,使用独立验证代理验证每个轨迹,并将反馈汇总为推出级别摘要。经验代理将可重用的低级推理信号提取到经验库中,而指南代理则在指南库中记录先前探索的高级策略。然后,这两个内存库将在后续迭代中使用,以支持基于经验的细化和非冗余探索。