论文
Memorizon:训练超越上下文窗口的世界模型
Memorizon: Training World Models Beyond Their Context Window
摘要
流世界模型应该在重复访问时一致地呈现一个地点。直接监督此类重访需要训练样本来捕获两次访问,通常持续几分钟。然而,对整个跨度的集中关注会产生二次成本,使得长跨度的监督成本高昂。 Memorizon 打破了这种耦合:监督需要长跨度,但注意力不需要,因为两次访问可以共享前向传递,而不包含每个中间帧。训练样本涵盖任意长度的跨度,但仅在其最后的 $k$ 块上进行评分。每个评分块不是对它们之前的历史进行标记,而是通过相机共同可见性检索其自己的顶级 $K$ 潜伏,并且这些请求的联合形成一个共享库。该银行以 $kK$ 为界,因此无论跨度有多长,序列都保持有界;最短的时间里,这个方法就是传统的训练。添加银行会增加一次步骤的成本;除此之外,较长的跨度成本很低,并且从 100 秒增加到 400 秒会增加 12% 的步进时间。相对于滑动窗口基线,检索提高了每次分割的重访一致性,并且足够长的跨度以达到每次返回的第一次访问,进一步增加了 24% 到 30%,但代价是图像质量有所下降;超过这个范围,再长的长度就不再有帮助了。从另一个事件填充银行会使重访相关性降低 83%,因此该模型使用它检索到的内容。项目页面:https://tingtingliao.github.io/memorizon