论文

DynaViewW:用于理解分层视觉动力学的模式引导世界建模

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

模型架构新型架构

摘要

多模态 LLM 努力系统地模拟视频或多图像序列中视觉场景的时间演化。此类输入需要模型来预测或模拟多个级别的动态成分,例如视觉序列中采取的动作以及由此产生的视觉环境的相关变化。为了应对这一挑战,我们提出了一种动态模式引导的世界模型 DynaVieW,针对视觉动态预测和模拟进行了优化。 DynaViewW 通过学习交错的状态转换序列实现对视觉动态的深入理解,其中状态涵盖视频关键帧的广泛视觉场景,而转换捕获分层模式中的全面动态成分。 DynaViewW 在专家混合架构下联合建模转换预测和状态模拟,具有跨专家选择性注意和模式标记重新加权损失,以确保有效和稳健的学习。 DynaVieW 对视觉动态的理解提高了其在视觉叙事创作和世界模拟方面的下游性能,显示出更高的一致性、可控性和指令遵循性。