论文
MemoryAgentBench冲突消解评测中的规则与金标准审计
Bookkeeping, Composition, or Unreachable Gold? Reading MemoryAgentBench's Conflict-Resolution Scores Against a Frozen Last-Write Resolver
摘要
MemoryAgentBench 的冲突解决方案被解读为衡量“选择性遗忘”。我们执行基准测试自己的规则 - 关于事实的最新陈述获胜 - 作为冻结在四个事实列表之一上的零学习解析器。根据官方指标,该规则回答了 80.25% 的问题(三个保留列表中的 74.5%)。其余的 67 个项目具有已发布的黄金,最后写入的图表无法达到,但可以覆盖语句(“印度首都是新德里。”被“印度首都是格罗塞托。”取代;黄金新德里);此类问题占 262K 多跳问题的三分之一。两个长上下文模型和我们预先注册的基准 BM25 Agent的近似重新实现(仅每个项目和结果一个保留运行)在规则解决的项目上得分为 84.7%、82.6% 和 41.6%,而在这 67 个项目上得分为 10.4%、11.9% 和 6.0%。失败是可达性分裂加上小的解析器范围残差;每个项目的拆分(而不是聚合)是此处可以读取分数的单位。