论文
CODESKILL:为编码智能体学习自演化技能
CODESKILL: Learning Self-Evolving Skills for Coding Agents
摘要
编码智能体在解决软件工程任务时会产生丰富的轨迹。为实现智能体自我演化,这些轨迹可被蒸馏为可复用的程序性技能,以紧凑方式编码经验,指导未来行为。然而,现有的技能构建与维护方法往往依赖固定提示和启发式更新规则,知识应如何被选择、抽象和维护才能最好地服务下游智能体,仍不明确。我们提出CODESKILL,一个基于LLM的框架,将技能提取与技能库维护重新表述为可学习的管理策略。CODESKILL从编码智能体轨迹中提取多粒度程序性技能,随新经验演化技能,并维护一个紧凑的技能库用于未来任务求解。我们用强化学习训练CODESKILL,其混合奖励将基于量规(rubric)的密集技能质量反馈与来自冻结下游智能体的稀疏可验证执行反馈相结合。在EnvBench、SWE-Bench Verified和Terminal-Bench 2上的实验表明,CODESKILL将平均通过率相对无技能基线提高9.69,相对最强的基于提示或记忆的基线提高4.01,同时在迭代构建过程中保持技能库规模稳定。
