DynFrame:自适应推理驱动的多模态框架,具有动态帧增强功能,可实现复杂视频理解
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
摘要
最近的视频多模态 大语言模型 (MLLM) 越来越多地将分步推理与按需视觉证据检索结合起来,允许模型在推理过程中重新访问相关视频片段。然而,现有的视频思维系统仍然存在两个结构性差距。 (i) 采样密度不是一个可以学习的决定:现有的方法可以让模型决定看哪里,但每个窗口的帧速率基本上是固定的。因此,细粒度的证据通常通过重复的检索调用来恢复,这增加了推理上下文的长度和训练难度。 (ii) 检索和答案生成通常通过单一轨迹级优势进行优化,因此“在哪里看”标记和“如何回答”标记即使一个正确而另一个不正确时也会获得相同的信用。为了解决这些差距,我们提出了 DynFrame,这是一个框架,它在单个自回归过程中将时间窗口和采样密度作为本机标记发出。这种可学习的跨密度检索能够通过单个检索步骤获取多粒度证据。基于上述标记化检索接口,我们进一步引入了分段解耦GRPO(SD-GRPO),它在检索边界处分割每个rollout,并分配特定于角色的词元级优势,分别记入采样决策和答案。 DynFrame-4B 在精选的 DM-CoT-74k 和 DM-RL-45k 上进行训练,在六个基准测试(NExT-GQA、Charades-STA、ActivityNet-MR、Video-MME、MLVU、LVBench)上与强大的 7B-8B 基线竞争,而 DynFrame-8B 在大多数指标上设置了新的最先进技术。代码可在 https://github.com/zhangguanghao523/DynFrame 获取。