论文

面向WebAgents的Agentic测试时扩展

Agentic Test-Time Scaling for WebAgents

模型推理测试时计算扩展

摘要

测试时间缩放已成为提高神经网络模型性能和可靠性的标准方法。然而,它在代理、多步骤任务上的行为仍然不太被理解:每一步的小错误可能会在长期内复合;我们发现,统一增加抽样的幼稚政策显示出收益递减。在这项工作中,我们提出了 CATTS,这是一种为多步代理动态分配计算的简单技术。我们首先对网络代理的推理时间缩放进行实证研究。我们发现,在长期环境中,均匀增加的每步计算很快就会饱和。然后,我们研究更强大的聚合策略,包括基于 LLM 的仲裁器,它可以超越朴素投票,但可以推翻高度共识的决策。我们表明,从代理自身投票分布(熵和 top-1/top-2 余量)得出的不确定性统计数据与下游成功相关,并为动态计算分配提供了实用信号。基于这些发现,我们引入了置信度感知测试时间缩放(CATTS),它仅在决策真正有争议时才使用投票产生的不确定性来分配计算。与 React 相比,CATTS 在 WebArena-Lite 和 GoBrowse 上的性能提高了高达 9.1%,同时使用的token比统一缩放少了 2.3 倍,从而提供了效率提升和可解释的决策规则。

面向WebAgents的Agentic测试时扩展
图1:智能体推理时扩展(inference-time scaling)方法的比较。对智能体每一步选择策略的可视化比较。左:Majority Voting 采样 N 个候选,并通过在投票分布 p_t(a) 上取 argmax 选择最频繁的动作。中左:Arbiter 采样 N 个候选,并使用一次额外的 LLM 调用对候选进行推理以选出最佳动作。中右:CATTS 仅在由投票导出的不确定性(熵 H_t 或间隔 Δ_t)超过阈值 τ 时才条件性地调用 Arbiter,否则回退到多数投票。