论文
通过验证门控技能优化进行认证的长期代码Agent进化
Certified Long-Horizon Code Agent Evolution via Validation-Gated Skill Optimization
摘要
无需更新模型权重的长程Agent自演进,是让已部署Agent积累可复用Skill并持续改进的重要途径。已有研究主要关注短程任务;仓库级软件工程虽适合检验长程适配,却尚缺研究。在这一场景中,Agent需要依次解决任务流、处理不断变化的仓库及复杂依赖,并持续保存和复用经验。文本Skill优化是一种高效的非参数适配方式,但已有方法在长期部署中容易出现更新不稳定、性能回撤和Agent能力崩溃。本文形式化上下文自演进,并提出验证门控的长程Skill优化框架VALVE。我们证明有限收敛,为未来任务增益与回撤给出理论保证,并推导达到指定容差所需的验证及评估留出集大小,其主导阶缩放关系为N\gtrsim s^{2}L/\gamma^{2}。实验中,VALVE在超过1,000个SWE任务的演进过程中实现稳定自改进,在GPT-5.5、Claude-4.6和MiniMax-M2.7三个前沿模型上,最终及峰值增益平均分别为14.9和16.5个百分点。验证门将平均回撤降低75%,并使Skill库比无门控演进紧凑11倍。我们还开展广泛消融,识别对长程Skill演进最关键的设计选择。