论文
学习要记住的事情:长期反事实内存优化
Learning What to Remember: Long-horizon Counterfactual Memory Optimization
摘要
持久的文本记忆允许语言模型在长时间的交互中携带信息,但学习要记住什么从根本上来说是一个信用分配问题。内存重写可能只会在许多步骤之后变得有用,而许多观察到的效用可能是从重写之前已经存储的信息继承的。我们引入了内存增益策略优化(MGPO),它通过将每次内存重写的增量值归功于其对当前和未来下游效用的边际贡献来隔离它。这将延迟的记忆效用转变为直接学习信号,用于优化应保留的信息。我们研究文档级信息提取的 MGPO,其中结构化监督使得个体记忆更新的影响可以直接测量。 MGPO 改进了提取,同时相对于优化前的初始内存策略将平均内存长度减少了近 80%。学习到的内存策略还支持跨域、下游模型的重用和传输,无需进一步训练。这些结果表明,有效的记忆学习不仅取决于保留有用的信息,还取决于识别哪些记忆更新可以创造持久的增量价值。