论文

扩展代理编码的测试时间计算

Scaling Test-Time Compute for Agentic Coding

模型推理测试时计算扩展

摘要

测试时间缩放已成为改进 大语言模型 的有效方法。然而,现有方法最适合可以直接比较、排名或细化的简短、有界的输出。长视野 编码智能体 违反了这个前提:每次尝试都会产生一个由代理采取的行动、观察、错误和部分进展的扩展轨迹。在这种情况下,主要的挑战不再是产生更多的尝试,而是以一种可以有效选择和重用的形式呈现先前的经验。我们提出了一种基于采样轨迹的紧凑表示的代理编码的测试时间扩展框架。我们的框架将每条采样轨迹转换为结构化摘要,保留其显着假设、进展和故障模式,同时丢弃低信号跟踪细节。这种表示形式支持两种互补形式的推​​理时间缩放。对于并行扩展,我们引入了递归锦标赛投票(RTV),它通过小组比较递归地缩小采样轨迹摘要的范围。对于顺序扩展,我们通过根据从先前尝试中提取的摘要来调整新的采样轨迹,从而使 Parallel-Distill-Refine (PDR) 适应代理设置。我们的方法持续改进了前沿 编码智能体 在 SWE-Bench Verified 和 Terminal-Bench v2.0 中的性能。例如,通过使用我们的方法 Claude-4.5-Opus,SWE-Bench Verified(迷你 SWE 代理)上的性能从 70.9% 提高到 77.6%,而 Terminal-Bench v2.0(Terminus 1)上的性能从 46.9% 提高到 59.1%。我们的结果表明,长视野代理的测试时间扩展从根本上来说是一个表示、选择和重用的问题。