论文

记忆驱动智能体自我进化的边际优势积累

Marginal Advantage Accumulation for Memory-Driven Agent Self-Evolution

上下文与知识记忆Agent记忆

摘要

在批处理样式跟踪 蒸馏 中,相同的内存操作可能会在不同的批处理中收到矛盾的反馈。现有方法缺乏跨批次、操作级​​的证据积累机制,无法区分稳定有效的操作和意外命中。本文将要求形式化为两个结构条件:可对齐性和可比性,并提出边际优势积累(MAA)。 MAA 构建差异信号以使其跨批次具有可比性,通过 EMA 累积每次操作的签名证据,并通过语义身份合并确保跨批次可追溯性。作为后处理架构,MAA 在 4 个基准和 4 个目标模型的 16 个设置中的 14 个中取得了最佳结果,始终优于现有的批处理级 蒸馏 基线,并在大多数设置中匹配或超越在线替代方案,同时将优化阶段词元消耗减少约 75%。