用于强化学习的反馈归一化开发者记忆 编码智能体:安全门控 MCP 架构
Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture
摘要
大语言模型 (LLM) 编码智能体 越来越多地在长期软件工程事件中对存储库、终端、测试和执行跟踪进行操作。持久记忆很有用,但静态向量存储或通用检索增强生成 (RAG) 不足以用于强化学习 (RL) 代码开发,其中小细节可能会改变 Bellman 目标、终端掩码、梯度流或验证声明。本文介绍了 RL 开发人员记忆,这是一种适用于 RL 编码智能体 的本地优先、模型上下文协议 (MCP) 原生开发人员记忆架构。它将记忆选择视为一个记录的上下文决策过程:issue_match 对候选者进行排名并记录遥测,issue_feedback 将原始标签映射到有限的奖励,issue_record_resolution 将经过验证的解决方案链接到早期的检索事件。确定性排序器仍然部署,而上下文强盗残差策略在影子模式下运行,并且只能通过保守的 离策略 评估 (OPE) 门影响金丝雀行为。强化学习/控制记忆需要从理论到代码的元数据和审查门控治理。该系统根据 200 个确定性案例基准进行评估,其中包含 RL 算法错误、硬负例、审查门控 RL/控制案例和低风险故障。在相同提交比较中,确定性控制和全阴影/OPE均实现了80.0%的预期决策精度和100.0%的硬负抑制;完整的配置增加了学习遥测而不是精度增益。静态验证通过了11/11检查;动态集成通过了 10/10 例。证据报告限制:不支持主动学习策略部署和官方客户端 MCP 互操作性、实时全配置延迟倒退以及仍然存在 40 个残余非 RL 故障。其贡献是具有明确声明边界的可审计记忆控制架构,而不是通用编码代理改进声明。