论文

视频内存是否使用它检索到的内容?记忆特异性的因果审计

Does Video Memory Use What It Retrieves? A Causal Audit of Memory Specificity

模型评测模型行为与机制分析

摘要

视频模型越来越多地使用内存来保存长序列的信息,并假设收益来自检索和使用正确的过去内容。标准的记忆消融测试记忆是否有帮助,但不测试检索到的内容是否负责。我们直接使用读取时内存替换来测试这一点,它替换消耗的内存值,同时保持其余计算不变。这将记忆益处与记忆特异性区分开来,即记忆增益取决于检索内容的程度。在冻结的视频世界模型中,不包含特定评估内容的无身份控件基本上恢复了 Ego-Exo4D 和 7-Scenes 上的全部优势,以及 TUM 上约 70% 的优势。在 Ego-Exo4D 剂量反应中,随着这些值偏离观察到的训练记忆表征,恢复率从 102% 下降到 1%,支持表征修复作为此设置中最受支持的解释。 WorldMem 显示出分级依赖性。相对于零内容,来自同一轨迹的错误记忆恢复了 94.1% 的 PSNR 效益,而来自不相交轨迹和生物群落的供体则恢复了 43.7%。 SAM 2 显示出很强的内容依赖性。在 DAVIS 上,用有效的错误记忆替换正确的空间记忆将平均区域和边界得分从 0.926 降低到 0.182。当 MOSEv2 再次出现时,它从 0.459 下降到 0.000。这些结果表明,记忆增益可能取决于通用表征支持、更广泛的背景或确切的情节内容。读取时替换提供了区分它们的直接方法。