TWIST:会话记忆干预质量的拟议基准,附经人类验证的草稿对齐
TWIST: A Proposed Benchmark for Intervention Quality in Conversational Memory, with a Human-Validated Draft-Alignment
摘要
长会话记忆基准日益测试召回与提示式知识更新,近期工作则研究演化的用户信念与记忆状态。TWIST是一个针对互补且未被度量属性——干预质量——的拟议基准套件:已部署的记忆系统在通过自身的摄取/召回/审查界面行使功能时,是否在信念变化点上正确行动。四个轨道分别覆盖无提示的张力检测、对照记录审查外发草稿、以当前信念作答同时保留被取代历史,以及治理敏感召回。该套件扩展了LoCoMo的语料与harness,并为每个检测/阻止指标配备匹配的'不得过度检测'对照:表面匹配的困难负例为错误干预定价,因此任何轨道都无法通过'一律标记'来刷分。基准本身首先得到验证:独立、对金标准盲的双人标注加仲裁、裁判诱饵校准,以及可分性审计。在经人类验证的Track B v1.0键(161项,仲裁后kappa=0.85)上,没有任何受测配置能同时实现高矛盾召回、高困难负例特异性与高归因:flat-RAG基线检测到0.76-0.97的真实矛盾,但依据后端不同会错误标记16-43%的表面匹配安全草稿;而一个已部署的连贯性导向系统几乎从不过度标记(特异性0.98-1.00),却只捕获42%的真实矛盾——这是仅看召回的分数无法看到的权衡。由13个配置组成的基线阶梯定位了成因:每个金标准矛盾都可以仅凭其证据检测出(召回1.000);给定完整转录时,校准良好的模型几乎解决该轨道——这与可观的检索覆盖缺口一致;仅草稿的下限揭示了依赖模型的风格先验。一个系统的TWIST画像与其召回分数并列,衡量记忆是否知道何时干预、何时不干预。