论文
SLAP:变分视频语言建模的语义最小动作原则
SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling
摘要
在大型视频语言模型 (LVLM) 时代,稀疏帧采样的计算必要性造成了基本的“时间间隙”,使模型对关键因果转换视而不见。现有的依赖于生成幻觉(例如,潜在扩散)或自回归外推的解决方案通常无法在长期范围内保持语义一致性,遭受对象消失和能量不稳定的困扰。我们提出使用\textbf{语义最小作用原理(SLAP)}从概率生成到变分力学的范式转变。我们在经典力学和语义动力学之间建立了严格的同构,将潜在视频轨迹建模为由语义拉格朗日量控制的黎曼流形上的路径。通过将插值任务表述为通过离散欧拉-拉格朗日方程求解的边界值问题 (BVP),SLAP 自然地强制执行对象持久性,而无需像素级渲染。大量实验证明了我们提出的 SLAP 的有效性。