论文

学习记住什么:长程语言智能体经约束优化的可观测安全记忆保持

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

上下文与知识记忆Agent记忆

摘要

长视域语言智能体积累观察、推理痕迹并检索超出上下文窗口的事实,使记忆保留成为基本的资源分配问题。现有系统将保留视为局部的,并且不会在可观察性限制下对长期后果进行建模。为了填补这一空白,我们将记忆保留制定为一种受约束的随机优化,具有预算可行性、证据效用和延迟成本,包括错过、重新获取和陈旧惩罚。我们证明这个多步骤问题是 NP 困难的,使得精确的解决方案变得困难。此外,部署决策必须在部分可观察性的情况下做出。为了应对这些挑战,我们提出了 OSL-MR(记忆保留的可观察性安全学习),这是一种学习增强框架,强制在线可观察特征和离线可用监督之间严格分离。 OSL-MR 将根据已实现证据训练的证据学习器与混合评分启发式相结合,作为可部署的在线安全基线和归纳先验。该策略从交互数据中学习查询条件证据,并在相同的约束下保持可部署性。 LoCoMo 和 LongMemEval 上的实验表明,OSL-MR 的性能优于基于新近度、生成代理式和其他启发式基线,尤其是在预算紧张的情况下。混合评分先验提高了精确度和召回率,敏感性分析显示了跨成本设置的稳健性。在小型可解实例中,单步优化不足以预测未来的需求变化,而 OSL-MR 明显更接近动态规划最优值,证实了顺序公式的必要性并强化了我们的学习引导近似。这些结果建立了约束随机优化和优化引导学习作为长视野智能体内存管理的原则基础。

学习记住什么:长程语言智能体经约束优化的可观测安全记忆保持:论文配图
图 1:OSL-MR 框架概述。该框架将在线可观察的输入(查询、内存元数据、交互历史)与离线可用的监督(黄金证据、答案文本)分开。在冷启动期间,混合评分启发式选择预算 BtB_{t} 下的保留记忆并记录代理-用户交互数据(查询、响应和后续证据结果)。收集足够的数据后,使用黄金证据标签对证据学习者进行离线训练;然后,学习到的策略被冻结并部署,仅依靠在线特征进行推理。