论文

HLA-WM:长时域视频世界模型的混合线性注意力

HLA-WM: Hybrid Linear Attention for Long-Horizon Video World Models

模型架构混合架构

摘要

长视野视频世界模型需要持久的记忆来保持扩展 执行轨迹 的场景一致性。 Softmax 注意力通过不断增长的 KV 缓存保留完整的生成历史,而循环线性注意力将历史压缩为固定大小的状态,而记忆成本要低得多。然而,我们在门控 DeltaNet (GDN) 中发现了严重的远程遗忘,其中来自遥远但相关场景的信息因后续状态更新而逐渐减弱。为了解决这个限制,我们提出了 HLA-WM,一种无需训练混合线性注意框架,它将粗粒度几何引导检索与细粒度循环线性状态计算相结合。 HLA-WM 利用 GDN 的仿射结构来缓存紧凑的分块转换摘要,使用相机几何检索场景相关的历史块,并将它们重新组合为特定于查询的循环状态。在 $60$-第二个 SANA-WM-Bench 上,HLA-WM 改进了基础自回归生成器的所有六个聚合重访一致性和摄像机控制指标,无需额外的训练,包括 $0.74$ dB PSNR 增益和 $28.5\%$ 旋转误差减少。这些改进在下游细化后持续存在,并推广到 MBench-A,其中 HLA-WM 持续改进了所有四个子集的所有三个重访一致性指标以及 $547$ 样本上所有评估的推理模式。在 $60$ 秒上下文中,HLA-WM 相对于完整 KV 缓存将历史状态记忆减少了 $12\times$,同时导致推理吞吐量最多减少 $1.6\%$。这些结果表明,选择性可寻址循环记忆可以改善远程场景 召回率,同时保留 GDN 的效率优势。项目页面:https://caesarhhh.github.io/hla-wm/

HLA-WM:长时域视频世界模型的混合线性注意力的原论文方法或结果图
图 3:HLA-WM 概述。历史视频块由独立的 GDN 摘要表示。给定当前查询,几何引导检索选择场景相关的历史块以及持久接收器和最近的上下文。然后按时间顺序组合所选的摘要,以构建特定于查询的循环状态。