论文

通过累积行为规则自我完善AI 编码智能体:闭环框架

Self-Improving AI Coding Agents Through Accumulated Behavioral Rules: A Closed-Loop Framework

智能体系统Agent Harness

摘要

基于 LLM 的 编码智能体 在各个会话中重复相同类别的错误,因为它们缺乏保留人工审核反馈更正的机制。我们提出了一个闭环框架,其中每个接受的评论评论都被编码为持久的行为规则,逐步扩展代理可以自我检测的错误类别集。该框架结合了版本控制指令文件中的累积规则集、代码提交前执行的自我审查清单以及确保规则集增长时完整性的自动验证。在跨 35 多个服务微服务平台的部署中,规则集从 5 条增加到 18 条行为规则、15 条以上特定于语言的标准以及 15 项自我审查清单,所有这些都源自真实的审查反馈。我们展示了 11 个记录的工作会议的实证结果,涵盖代码生成、PR 审查、事件调查和跨服务重构。我们观察到,积累的规则将审查工作从基础正确性转向设计级验证,针对规则错误类实现测量的 0% 复发率,并跨异构代理接口进行转移。我们将我们的方法与体验式 LLM 学习(Reflexion、ExpeL、Voyager)和自动代码审查(CodeReviewer、SWE-bench 代理)中的相关工作进行比较,表明我们的框架在没有权重更新的情况下实现了持久的跨会话学习,在生产代码库而不是综合基准上运行,并解决了现有基准无法测量的正交维度(随时间的行为一致性)。结果是 编码智能体 在每个审核周期中都会得到改进,积累了人类合作者的工程智慧,而无需更改单个模型权重。