论文
Socratic-SWE:通过跟踪衍生代理技能自我进化 编码智能体
Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills
摘要
LLM 驱动的软件工程代理已成为现实世界语言模型能力的中心测试平台,但它们的训练仍然受到高质量 SWE 任务可用性的限制。现有的合成数据方法通常通过固定突变或错误注入程序来创建任务,从而使所得分布在很大程度上独立于智能体自身的弱点和训练进度。我们引入了 Socratic-SWE,这是一个闭环自进化框架,它重用智能体的历史求解轨迹作为训练信号源。 Socratic-SWE 不仅仅将痕迹视为奖励计算的证据,而是将其提炼为结构化的代理技能,总结重复出现的故障和有效的修复模式。然后,这些技能指导在真实存储库中生成有针对性的修复任务。通过基于执行的验证来检查候选任务,并通过求解器梯度对齐奖励进行评分,以便保留的任务既可验证又可用于改进求解器。更新后的求解器会产生新的轨迹,使任务课程能够适应连续的轮次。在 SWE-bench Verified、SWE-bench Lite、SWE-bench Pro 和 Terminal-Bench 2.0 中,Socratic-SWE 在相同的计算预算下持续改进自我进化基线,经过 3 次迭代后在 SWE-bench Verified 上达到 50.40%。这些结果表明,解决痕迹可以作为自我进化 SWE 代理的可扩展基础。