论文

表示,而不是机制:弃用感知内存评估中的渲染混淆

Presentation, Not Mechanism: A Render Confound in Deprecation-Aware Memory Evaluation

模型评测评测方法与指标

摘要

人工智能系统越来越多地从可自行修改的记录中检索:问题线索、百科全书式历史、政策日志和长时间对话。挑战不仅在于找到相关证据,还在于决定哪些主张仍然有效,哪些主张被取代,以及何时放弃。结构化记忆有望通过类型边缘、时间更新和冲突状态来解决这个问题,但评估通常会同时改变机制和提示表示。我们将其作为证据状态修订进行研究,对来自 GitHub、多存储库问题历史、维基百科和 DyKnow 风格时间流的 2,907 个高一致性问题进行比较平面检索、粗边缘失效和细粒度 RevisionLedger。渲染匹配的控件(相同的布局,禁用弃用)揭示了主要的混乱:当值发生更改并随后恢复时,RevisionLedger 似乎比平坦基线高出 +0.182,但几乎所有收益都来自于更容易的呈现;细粒度机制残差与零没有区别(两个法官家族的+0.021到+0.025)。在控制呈现之后,粗略失效是为当前状态查询付费的唯一机制,比精细账本高出 0.084;同样的查询充分性原则表明出处主要需要保留无效的证据,而不是更丰富的类型。内存评估应该保持渲染固定,并且弃用感知系统应该部署覆盖其查询的最粗略的保留状态。