论文

HY-Himmel 技术报告:用于长视频理解的分层交错多流运动编码

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

应用与实践视觉感知与空间理解

摘要

使用多模态语言模型的长视频理解面临三个复合瓶颈:获得密集 RGB 帧的大量解码成本、帧计数的二次词元增长以及稀疏关键帧采样下的弱运动感知。我们提出了 HY-Himmel,一种分层视频语言框架,可以分别分配语义和运动容量。一小组稀疏的锚点 I 帧被路由到昂贵的主机 ViT,以实现地面物体身份和场景布局,而更密集的帧间间隔则由​​轻量级压缩域三流适配器进行编码,该适配器从运动矢量图、残差图和 I 帧上下文中提取运动证据,形成对齐的运动词元。在专用的 Stage-1 对比对齐之后,这些词元通过可微的占位符机制注入到 LLM 中,该对齐将运动表示放置在与冻结视觉主干兼容的几何形状中。在 Video-MME 上,HY-Himmel 超出了密集 32 帧基线 +2.3 pp(61.2% 到 63.5%),同时使用的上下文标记减少了 3.6 倍。对流组成、运动编码器系列、融合模式、对齐目标、锚点计数、LoRA 等级和视频持续时间的广泛消融证实,完整的三流对于观察到的增益是必要且充分的。