论文

内存作为基础设施:数月之久的持久代理内存可靠性工程 LLM 辅助开发

Memory as Infrastructure: Reliability Engineering for Persistent Agent Memory in Months-Long LLM-Assisted Development

上下文与知识记忆Agent记忆

摘要

LLM 编码智能体 正在从任务规模跨越到项目规模:在远大于任何上下文窗口的代码库上运行数月的单一辅助工作,跨越重复的上下文压缩。我们报告了此类工作的运营经验(自 2026 年 1 月以来在单个连续 Claude 代码会话线下的一个研究项目,驱动了 633,000 行代码库,自 2026 年 7 月以来不断对其内存子系统进行检测),并描述了 SIx Harness,这是为了保持其一致性而出现的开源内存和连续性基础设施。该工具结合了每个项目的长期记忆(通过 SQLite 的混合词汇向量检索,完全本地化)、精确门控上下文注入、用于决策和死胡同的防重复存储、为承受压缩而设计的约定,以及我们认为在操作实践中缺失的部分、内存子系统本身的可靠性工程:具有可区分故障模式的会话启动健康门、心跳遥测设计,以便没有枚举的故障模式可以通过未记录的情况,以及警报疲劳预算借鉴SRE实践。我们展示了我们认为是生产开发使用中持久代理内存子系统的第一个几个月规模的仪表化操作记录:78,933 次钩子调用; 85 起记录故障,无一例外:84 起发生在子系统的前三周内,此后发生了 1 起,最后 20 天内没有发生过;注入层的十天精密仪器显示相对于完整分母零假火;三起生产事故从仪器读数到结构修复进行了追溯。从记录中,我们提炼出七个设计原则,明确说明我们的局限性(N = 1,无控制臂,自我报告),并发布一个标记的预注册消融协议,任何团队都可以使用已发布的麻省理工学院许可的套件来运行。