论文

分歧以探索,一致以提交:面向软件智能体的路由引导测试时扩展

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents

模型推理模型架构MoE测试时计算扩展

摘要

软件工程智能体通过漫长、随机的工具使用轨迹解决仓库级任务,多次尝试常能发现单次运行错过的修复。测试时扩展之所以困难,是因为补丁缺乏规范答案形式,而来自共享前缀的兄弟动作彼此相关。我们研究原生的MoE路由轨迹能否在无需外部裁判或选择时测试执行的情况下引导转向与选择。我们的分析表明,路由提供了稳健的行为角色信号;token粒度读取和决策匹配比较集将其转化为有效控制。因此我们提出Risa(Routing-Informed Steering and Arbitration):在轨迹内,路由在补丁提交时鼓励多样探索和受控收敛;在独立采样的轨迹之间,在信息性补丁位置上的一致性选择最终候选。我们在SWE-bench Verified上评估,使用跨规模和推理努力设置的开源权重稀疏MoE智能体。Risa的路由仲裁将gpt-oss家族上均匀采样的宏平均解决率从44.9%提高到48.2%,无需答案串匹配即可匹配文本共识,并可迁移到Qwen3.6,在完整500任务基准上优于均匀选择并与文本共识持平。

分歧以探索,一致以提交:面向软件智能体的路由引导测试时扩展:论文配图
图4:Risa:一种 MoE 路由表示,三种与决策相匹配的比较。探索性动作与近期已执行历史比较;补丁写入动作与其经角色门控的同组动作比较;累积的最终补丁与在决策 token 上单独采样的尝试比较。