论文
COMET:视频多模态的对比运动增强时间推理 大语言模型
COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models
摘要
视频多模态 大语言模型 取得了显着进步,但细粒度的运动时间理解仍然脆弱。核心瓶颈不仅在于稀疏帧采样,还在于缺乏完整的时间建模管道来显式表示帧间变化、实现外观-运动交互以及优化时间方向敏感性。我们提出了 COMET,一个基于时间的框架,通过显式时间表示、外观运动融合和方向感知优化来系统地增强视频 MLLM。在架构上,COMET 引入了基于泰勒帧差异的时间运动分支,并通过时间注意偏差增强的交叉注意将其运动证据注入到外观流中。为了优化,COMET 将时间先验 蒸馏 与前向-反向 TC-GRPO 阶段相结合,将时间顺序转化为直接学习信号,并加强模型对时间运动分支编码的定向运动模式的使用。该方法通过明显的运动时间偏差实现了一致的整体改进:在 Qwen3-VL-8B 上,以动作为中心的任务(STAR、SSv2)平均提高了 4.9%,时间推理任务(NExT-QA、CLEVRER、LLaVA-178K)比 BL-GRPO 提高了 2.1%,而静态感知任务(PerceptionTest)保持不变。相同的增益模式也转移到 InternVL2.5-8B,表明 COMET 可以推广到各个模型系列。