论文

学习 编码智能体 的全局可重用技能

Learning Globally Reusable Skills for Coding Agents

智能体系统Agent Harness

摘要

自动化技能进化使 大语言模型 (LLM) 座席能够持续改进,而无需进行昂贵的再培训。然而,现有的方法通常将技能演化视为一系列局部更新,忽略了技能之间的关系,并且经常产生过度拟合的技能更新,而无法跨任务泛化。我们提出GSE,一个全球化的技能进化框架,共同优化技能兼容性和技能泛化。为了保持整个技能库的一致性,GSE 维护了一个技能关系图 (SRG),它明确地建模和共同发展技能间的关系。为了提高泛化能力,GSE 执行基于集群的技能整合,从本地更新中抽象出可重用的功能,并采用重放驱动的验证来防止过度拟合和行为回归。我们在两个代表性的软件工程任务上评估 GSE:错误揭示测试生成和误报错误报告过滤。在两个最先进的 编码智能体、OpenHands 和迷你 SWE 代理中,GSE 始终实现最佳的精度、召回率和 F1 分数。与现有的进化技术相比,GSE在测试生成方面提高了精度和召回率6.1%~34.1%和31.8%~180.0%,在误报过滤方面提高了15.4%~96.4%和13.1%~19.8%。在内部工业代理上的部署进一步使 F1 分数提高了 61.4%,证明了 GSE 在发展有效技能方面的有效性和通用性。