论文
MLLM 在说话之前就知道什么时候:通过注意力线索揭示和恢复视频时序定位
MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues
摘要
视频视频时序定位 (VTG) 可定位未修剪视频中查询事件的开始和结束时间,是多模态 大语言模型 (MLLM) 是否不仅了解发生的情况而且了解发生时间的关键测试。尽管现代 MLLM 可以流畅地描述视频内容,但它们的时间戳预测仍然不可靠,而现有的补救措施要么需要昂贵的 后训练 时间注释,要么依赖粗略的 无需训练 启发法。在这项工作中,我们探讨了 MLLM 的跨模式注意力并揭示了感知-生成差距。我们的主要发现是,MLLM 通常在预填充期间知道目标间隔,但在生成最终答案时会丢失此信号。在预填充阶段,一组稀疏的注意力头,我们称为视频时序定位头(TG-Heads),将查询到视频的注意力集中在 真值 间隔上。然而,在自回归解码期间,答案标记将注意力从该间隔转移到视觉上显着但与查询无关的片段。这一观察激发了推理时间读取然后重新生成的框架。我们首先将 TG-Head 预填充注意力转换为去偏的帧级相关信号,并提取其突出显示的高注意力区间。然后,我们使用视频裁剪将视觉上下文限制在该间隔内重新调用 MLLM。在没有参数更新或架构变化的情况下,我们的框架在三个基准上持续改进 MiMo-VL、Qwen3-VL 和 Molmo2,增益高达 +3.5 mIoU。该项目网站可以在 https://ddz16.github.io/mllmsknowwhen.github.io/ 找到。