论文

ATANT v1.1:连续性评估相对记忆、长上下文与智能体记忆基准的定位

ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory Benchmarks

模型评测上下文与知识上下文工程记忆评测方法与指标Agent记忆

摘要

ATANT v1.0(arXiv:2604.06710)将连续性定义为一种系统属性,包含7项必备性质,并引入了10检查点、无需LLM的评估方法,已在250篇故事的语料上完成验证。自发表以来,审稿人与从业者反复提出的问题并非关于该框架本身,而是它与更广泛的一组记忆评估的关系:LOCOMO、LongMemEval、BEAM、MemoryBench、Zep的评估套件、Letta/MemGPT的评估以及RULER。这篇伴随论文v1.1不修改v1.0标准。它补上了v1.0因页面限制而仅简略带过的相关工作空缺。我们通过结构分析表明,这些基准无一测量v1.0所定义的连续性:在7项必备性质中,现有评估覆盖性质数的中位数为1,按部分得分0.5计算时均值为0.43,且没有任何评估覆盖超过2项。我们提供逐格的性质覆盖矩阵,指出各基准特有的方法学缺陷(包括LOCOMO参考实现中的空标准答案计分缺陷,使其语料库中23%在构造上不可评分),并公布我们参考实现的LOCOMO分数(8.8%)以及该数字对连续性不具信息量的结构性原因。我们将8.8%的LOCOMO分数与96%的ATANT累计尺度分数一同公布,作为一对校准样本:87分的差异证明两个基准测量的是不同性质,而非某个系统比另一个好一个数量级。v1.1所持立场并非对抗性:每个基准都测量一种真实能力。我们的论点是,它们之中没有一个能够裁决连续性,而将它们与连续性评估混为一谈,已使该领域对v1.0所列性质的投入不足。