论文

ExComm:面向错误韧性智能体测试时扩展的探索阶段通信

ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

长周期智能体测试时扩展中一个常见的失败模式是错误传播:中间步骤引入的事实错误或无效推论会驻留在智能体的信念状态中,并污染后续推理。现有测试时扩展方法对这一过程的控制有限,因为它们通常依赖智能体自行发现错误、在带缺陷的轨迹中进行挑选,或只在错误已经塑造推理路径之后才精修解决方案。我们提出ExComm,一种面向探索阶段智能体测试时扩展的通信协议。ExComm的动机来自一个经验观察:并行智能体推理中的大多数中间错误会产生可检测的跨智能体事实冲突。借助智能体工作流的迭代结构,ExComm定期审计智能体的信念状态以检测此类冲突,通过专门的基于工具的验证循环解决冲突,并向相关智能体返回简洁而有针对性的反馈。修正以软信念更新的方式并入:追加经验证的反馈,而不是覆盖既有信念。此外,为防止通信导致轨迹多样性坍缩,ExComm进一步引入一个轨迹多样化模块,把冗余轨迹引导到正交策略上。在AIME 2024、AIME 2025和GAIA上使用Gemini-2.5-Flash-Lite与Qwen3.5-4B的实验表明,ExComm持续优于强大的测试时扩展基线,相对表现最好的基线分别取得平均5.7%和5.0%的性能提升。进一步分析显示了更好的错误恢复、良好的扩展行为、比改造后的通信基线更强的多样性,以及在所评估方法中最佳的性能-成本权衡。

ExComm:面向错误韧性智能体测试时扩展的探索阶段通信:论文配图
图 1:ExComm 概述。 ExComm 通过探索阶段通信步骤增强了标准代理测试时间缩放循环。在每个执行步骤之后,在线信念一致性模块会收集代理信念状态 {Bi}i=1N\{B_{i}\}_{i=1}^{N},检测事实冲突,通过工具增强验证解决它们,并生成一组有针对性的解决方案 ℛ\mathcal{R}。每个代理 𝒜i\mathcal{A}_{i} 仅接收相关子集 ℛi⊆ℛ\mathcal{R}_{i}\subseteq\mathcal{R},通过附加经过验证的反馈而不覆盖先前的信念状态,将其用作软信念更新。同时,轨迹多样化模块分析代理计划 {Pi}i=1N\{P_{i}\}_{i=1}^{N},识别冗余策略,并生成一组多样化指令𝒟\mathcal{D}。当指令分配给智能体 𝒜i\mathcal{A}_{i} 时,它会接收 di∈𝒟d_{i}\in\mathcal{D} 并更新其计划以鼓励正交探索。更新后的代理然后在下一个探索步骤中继续基本执行循环。