论文

学习何时记住:基于 LLM 的 编码智能体 中用于缺席感知记忆检索的风险敏感上下文强盗

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

上下文与知识记忆Agent记忆

摘要

基于 大语言模型 (LLM) 的 编码智能体 越来越依赖外部存储器来重用先前的调试经验、修复跟踪和存储库本地操作知识。然而,仅当当前故障与前一个故障真正兼容时,恢复的记忆才有用。堆栈跟踪、终端错误、路径或配置症状的表面相似性可能会导致不安全的记忆注入。本文将问题记忆使用重新定义为选择性的、风险敏感的控制问题,而不是纯粹的 top-k 检索问题。我们引入了 RSCB-MC,一种风险敏感的上下文老虎机记忆控制器,它决定代理是否应该不使用记忆、注入优先候选解决方案、总结多个候选者、执行高精度或高召回率检索、弃权或寻求反馈。该系统通过模式变体情节模式存储可重用的问题知识,并将检索证据转换为固定的 16 个特征上下文状态,捕获相关性、不确定性、结构兼容性、反馈历史、误报风险、延迟和词元成本。其奖励设计对误报记忆注入的惩罚比对错过重用的惩罚更严厉,从而使不注入和放弃成为一流的安全操作。在确定性烟雾尺度伪影中,RSCB-MC 获得了最强的非预言机离线重放成功率,达到 62.5%,同时保持 0.0% 的误报率。在有限的 200 例热路径验证中,它达到了 60.5% 的代理成功率,误报率为 0.0%,p95 决策延迟为 331.466 微秒。结果表明,对于编码智能体记忆,关键问题不仅在于哪个记忆最相似,还在于任何检索到的记忆是否足够安全以影响调试轨迹。