MemStrata:使用本地 Qwen 3.8 27B Q4_K_M 读取器在 LongMemEval-500 和 LoCoMo-1540 上实现 95% 和 90.91% 的源感知准确度
MemStrata: 95% and 90.91% Source-Aware Accuracy on LongMemEval-500 and LoCoMo-1540 with a Local Qwen 3.8 27B Q4_K_M Reader
摘要
适当的对话答案可能不同于简短或不完整的基准参考。为了根据记录的历史来衡量充分性,我们更喜欢源感知评分,其中法官在评估系统盲答案之前对照完整源检查参考;原始仅供参考的分级会同时报告。使用本地 Qwen 3.8 27B Q4_K_M 阅读器和 24,000-token证据上限,在源感知 GPT-5.5 裁决下,MemStrata CL1 在 LongMemEval-S 上得分为 475/500 (95.0%),在 LoCoMo 类别 1-4 上得分为 1,400/1,540 (90.91%),相同答案的仅供参考评分时,分别为 463/500 (92.6%) 和 1,205/1,540 (78.25%)。它保留检索骨干模型并添加非重复的、过时的、说话者归属的源范围。同一读者的完整历史对照,证据分数约为 4.7 倍,仅参考分数为 464/500,源感知分数为 470/500 (94.0%);这两种差异都不是决定性的。相同预算下的仅关键字选择得分为 425,匹配的读取器 Letta 臂得分为 438。在 LongMemEval-M 上,数据包包含每个历史记录的约 1.6%,MemStrata CL1 得分为 427/500,损失集中在多会话和时间问题上。在 300 个 BEAM-1M 问题上,它的得分超过了密集检索,为 0.738 至 0.706(Wilcoxon p = 0.011)。未更改请求的相同种子重播改变了 1.5-2.3% 的标签。在相同的数据包上,GLM 5.3 闪存不差 3 分(462 比 463); Muse Spark 1.3 在 269 个问题上没有表现出非劣效性。四项预先注册的干预措施均不符合其所有注册的进展或可行性标准。签名的读取端工件支持检查,但不会重新生成私有检索管道。来源感知评分相对于人工判断的优越性尚未确定,并且开发暴露、自动判断依赖以及留出数据的缺乏排除了独立复制或排行榜声明。