论文

一分就够了吗?重新思考顺序演进的 LLM 存储器的评估

Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

模型评测评测方法与指标

摘要

内存在 大语言模型 (LLM) 通过随着时间的推移积累和重用经验来操作顺序任务方面发挥着核心作用。然而,现有的 LLM 内存评估主要依赖于最终保留精度或累积在线性能等聚合指标,这可能会掩盖遗忘和负迁移等关键故障模式。在本文中,我们介绍了 SeqMem-Eval,这是一种用于顺序演化 LLM 内存的诊断评估框架。它从持续学习中汲取灵感,目标是测试时设置,其中记忆是外部的、提示介导的,并且在不修改模型参数的情况下进行更新。 SeqMem-Eval 不只关注最终性能,而是评估记忆状态在顺序推理过程中如何演化、泛化、巩固经验以及保留有用信息。具体来说,它测量在线效用、保留泛化、向后迁移和遗忘,提供更细粒度的记忆质量视图。通过对不同任务和记忆方法的广泛实验,我们表明较高的最终或累积准确度并不一定意味着更好的记忆质量:许多方法在遭受大量遗忘或负迁移的同时表现出强大的性能提升。此外,不同的内存设计在适应性和稳定性之间表现出明显的权衡,而这些权衡在标准评估指标下仍然不可见。