R2M-Bench:通过交互式视频世界模型中的相对一致性评估重访记忆
R2M-Bench: Evaluating Revisit Memory via Relative Consistency in Interactive Video World Models
摘要
首次访问帧和返回帧之间的高度相似性并不一定表明视频世界模型记住了该场景;中间的生成轨迹可能只是改变很小。这种模糊性使得绝对重访分数对渲染稳定性、重复内容和失败的动作敏感。我们引入 \emph{R2M-Bench} (\textbf{R}elative \textbf{R}evisit \textbf{M}emory Benchmark),这是可观察的重访选择性一致性的基准。对于每个检测到的返回,R2M-Bench 会将重访对与同一生成轨迹中的两个控件进行比较:一个间隙匹配的非重访对,用于测量一般时间稳定性;一个短程对,用于估计短范围一致性。这些比较产生 \emph{MemoryGain} (MG),即相对于时间基线的重访优势,以及 \emph{归一化内存比率} (NMR),后者通过短于基线的动态范围标准化了这一优势。 R2M-Bench 将 100 个参考场景与三个离开和返回轨迹相结合,形成 300 个实例,并评估外观保真度、场景和对象身份、局部几何形状和持久状态。在七个动作条件视频世界模型中,总体 NMR 与 Spearman $ρ=0.547$ (95\% CI $[0.45,0.63]$) 的人类一致性判断相关。其模型内与生成运动的相关性幅度为 0.072 美元,而原始重访相似度为 0.207 美元,这表明相对校准大大减少了慢动作捷径。 DreamX-World-Memo 在评估的视频模型中实现了最高的整体 NMR。总之,这些结果支持同一生成轨迹内相对校准作为区分重访特定一致性和一般时间稳定性的实用方法。