论文

学习自适应并行执行以实现高效代码定位

Learning Adaptive Parallel Execution for Efficient Code Localization

模型训练强化学习Agentic RL

摘要

代码定位是自动化软件开发流水线的关键瓶颈。虽然并发工具执行可以加快发现速度,但当前智能体34.9%的冗余调用率抵消了并行化的收益。我们提出FuseSearch,将并行代码定位重新表述为质量-效率联合优化任务。通过定义工具效率——唯一信息增益与调用次数之比——我们采用两阶段SFT和RL训练方法学习自适应并行策略。与固定广度方法不同,FuseSearch根据任务上下文动态调节搜索广度,从探索阶段演化为精炼阶段。在SWE-bench Verified上评估,FuseSearch-4B取得SOTA级性能(84.7%文件级和56.4%函数级F1),加速93.6%,轮次减少67.7%,token减少68.9%。结果表明,效率感知训练通过消除噪声冗余信号自然提升质量,实现高性能、高性价比的定位智能体。

学习自适应并行执行以实现高效代码定位
图2:FuseSearch 框架概览。(a) 推理:智能体并行执行三个极简工具,追踪每个工具的信息增益以计算轨迹效率 e。(b) 训练:双指标过滤为 SFT 筛选高质量轨迹,随后使用 F1-效率联合奖励进行 RL 优化。