论文
LatentSift:用于软件工程Agent的词元高效验证的策略状态过滤
LatentSift: Policy-State Filtering for Token-Efficient Verification of Software Engineering Agents
摘要
测试时计算扩展通过生成多个候选轨迹并选择最佳轨迹来改进软件工程Agent。在这些长时间交互中进行验证和选择可能会消耗与生成本身一样多的词元。现有的混合工作流程首先应用基于 LLM 的免执行 (EF) 验证器在运行测试之前过滤候选者,这会在每个轨迹上添加另一个模型传递。我们引入 LatentSift,这是一种无词元且无需执行的过滤器,它用策略在生成候选者时已经生成的隐藏状态来取代第一阶段。它通过推理、观察和函数调用状态代表每个候选者,将它们与在政策训练期间从成功和不成功的轨迹中收集的此类状态的正向和负向银行进行比较,并将所得距离分数与学习的线性分数融合,以在基于执行的阶段保留有希望的候选者。在 SWE-bench Verified 上,跨三个Agent和两种策略大小,LatentSift 将 EF 验证者词元削减了 66.6--81.0%,在 K=16 时将总验证词元(包括测试生成)削减了 49.1--62.1%,而混合 Best@16 匹配或改进了每个Agent的参考工作流程,在 DeepSWE-Preview 上从 59.26% 上升到 60.06%。