论文

ExecCritic:学习测试、通过测试改进编码Agent

ExecCritic: Learn to Test, Test to Improve for Coding Agents

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

执行反馈可以指导编码智能体进行正确的存储库修复,但前提是测试捕获了问题所请求的行为。智能体生成的测试可以编码不完整或不正确的行为目标;当相同的轨迹写入补丁和测试时,它们的错误可能会一致并产生错误的信心。我们引入了 ExecCritic,将测试-验证-修订支架与用于在其中训练智能体的特定于角色的强化学习配方相结合。脚手架将测试构建与源代码修复分开:测试智能体独立生成存储库本机测试,故障关闭Harness验证并冻结它们,修复智能体根据执行反馈修改源代码而不更改测试。两个角色都使用 Qwen-3.5-35B-A3B 作为骨干,并分别进行训练。在学习测试中,测试智能体学习生成行为有效的测试,以区分正确的补丁和不正确的补丁。在“测试改进”中,修复智能体学习直接任务解决和反馈引导的修订。在 SWE-bench Verified 上,测试质量决定反馈是否有帮助:固定基础修复智能体,基础测试智能体的测试将解决率从无测试基线的 61.2% 降低到 57.3%,而 GPT-5.6-sol 的测试将其提高到 65.3%。针对特定角色的后期培训将 Qwen Test 智能体的基础到黄金成功率从 22.2% 提高到 62.2%;组成两个训练后的 Qwen 智能体达到 72.6%,比评估时没有更强模型或 Oracle 反馈的原始无测试基线提高了 11.4 点。代码可在此 https URL 公开获取。