论文

审核长期记忆评估:重复判断、读者变化和消极控制

Auditing Long-Term Memory Evaluation: Repeated Judging, Reader Variation, and Negative Controls

模型评测评测方法与指标

摘要

该报告审核了对 500 个 LongMemEval-S 开发问题的长期记忆检索链的评估。在改编后的 GPT-4o 评分标准下,其最强的历史读者通道得分分别为 479 和 475;重新判断相同的 pass-1 答案会改变三个标签并产生 478。固定答案知识更新重新评分在上游模板下给出 70/72,在修改后的模板下给出 69/72。固定数据包上的读取器通道跨度为 93 至 479;两条最强的历史车道之间的配对测试既不能确定优越性,也不能确定等效性。不同系列的阅读器,在没有客户端工具或操作员文件的情况下配置,得分为 474,比标题通过率低 1.0 个百分点(配对 95% 区间 [-3.0,+1.0])。未保留实时读者请求正文。使用相同的请求阅读器标签、路线和判断快照,完整包得分为 474,而基线会话得分为 454,相差 +4.0 个百分点 [95% 间隔 +2.2,+6.0]。 23 次增益中有 18 次发生在基线数据包缺乏列出的证据的情况下,并且没有损失;这种事后分割并不能识别成分效应。在恢复的 LoCoMo 数据中,词元 F1 增益无法在答案行提取中保留下来。阴性对照会拒绝修复三个错误草稿但破坏十一个正确草稿的验证者。所有问题都用于开发组件;没有评估未触及的保留。这些发现并没有建立新的排行榜领先者或可转移的记忆优势。 A/D 比较每臂一次,包括六个重复使用的相同提示结果,没有固定的读取器快照; B/C 和重复仍未运行。原始标题请求无法重建,并且阶段 1--4 仍然关闭。发布的工件支持数据包检查和保存的判决重新计数和重新评分;他们不重建该方法。