论文

CONTRAMEM:从对比多模型轨迹中学习自演化程序性记忆

CONTRAMEM: Learning Self-Evolving Procedural Memory from Contrasting Multi-Model Trajectories

上下文与知识记忆Agent记忆

摘要

自主计算机使用智能体正日益应用于需要协调多个应用调用、持续状态跟踪与对验证器敏感写入的长程任务,但它们仍容易出现程序性失败:误读应用状态、工具语义或任务进度。程序性记忆有望带来更一致的决策与更少的冗余探索,但在不训练模型的情况下构建高质量记忆仍然充满挑战。我们提出CONTRAMEM,一个源灵活、免训练的自演化程序性记忆框架,它把同一任务上的结果差异当作监督信号:正确性、效率、恢复与失败模式上的差异揭示了与结果相关的程序性区别,并将其蒸馏为一个紧凑的应用级功能卡(Function Cards)与任务级技能卡(Skill Cards)库,该库通过局部化整理而演化,而非只增不删的累积或整库重写。在留出的GAIA2/ARE计算机使用任务上,CONTRAMEM使三个源模型目标上的成功率翻倍以上(26.2%到55.3%),每个模型收益一致(GPT-5.5:27.5到61.0;Claude Sonnet 4.6:28.0到52.5;DeepSeek V4 Pro:23.0到52.5)。同一记忆库不加改动即迁移到未见的Qwen3.7 Plus(18.5到35.5),表明这是可迁移的程序性知识而非模型特有行为。同样的构造不加改动地延续到AppWorld,在两个公开测试划分上,对三个中档智能体都同时胜过无记忆与其单源自记忆变体。在匹配轨迹预算下,异构多模型轨迹产生比自记忆或同模型多次采样记忆更强的记忆:这一差距来自对比性的行为多样性,而非更强的源模型或更多采样。

CONTRAMEM:从对比多模型轨迹中学习自演化程序性记忆:论文配图
图1:在三个源目标(GAIA2/ARE)上取平均的留出成功率,以及目标宏平均 TGC/SGC(AppWorld):ContraMem 在每项指标上都胜过自身记忆(self memory)。