论文
相同的排名,不同的获胜者:评分目标如何塑造 LLM 记忆基准
Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks
摘要
会话记忆系统越来越多地将对话历史转化为事实、摘要、时间线和其他与源相关的后代,因此单个源转向可以与同一检索索引中的多个派生记忆共存。这就提出了一个未明确的评估问题:哪种存储形式应该获得检索信用?我们表明,这种评分目标的选择通常是隐含的,并且可以极大地改变基准结论。我们提出了 TIAP,这是一种固定输出审核,可以在三个目标(原始、源和规范)下重新评分已保存的排名输出,而无需重新运行检索。在 LoCoMo 和 LongMemEval-S 上,仅切换已记入的目标会更改 83.4--94.0% 共享查询的 nDCG,翻转 Mem0 和 MemoryOS 传输运行上的目标顺序,并反转解析器密度建议。 1,902 个案例的语义审计进一步表明,尽管验证子集中的标题可靠性很高,但宽松的源链接信用只有 29.2% 的时间是完全合理的。这些结果揭示了目标非不变性:有关内存架构的结论可以通过单一基准设计选择悄然翻转。因此,会话记忆论文应该明确定义和报告评分目标。