论文
运动即提示:通过运动引导跨帧视觉提示增强多模式 大语言模型 中的运动推理
Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting
摘要
以运动为中心的视频推理是机器人操作和自主导航等交互式应用的基础。然而,多模态 大语言模型 (MLLM) 通常通过稀疏均匀采样来处理视频,以控制视觉标记和注意力成本。该策略可能会丢弃采样帧之间的关键过渡,从而限制有关对象移动、碰撞和因果交互的推理。为了缓解这个问题,我们提出了 Motion-as-Prompt (MaP),一种轨迹引导的跨帧视觉提示框架。 MaP 恢复密集点轨迹,选择运动信息帧,并将连续采样帧之间累积的轨迹直接标记到视觉输入上,从而使冻结的 MLLM 可观察到其他隐藏的位移、方向变化和交互。 CLEVRER 和 Something-Something-v2 上的实验表明,MaP 持续提高了平均运动推理精度,GPT-5.5 的增益分别为 4.2% 和 8.9%。值得注意的是,这些改进是在不降低非运动理解的情况下获得的,突出了 MaP 的鲁棒性。这些结果表明,MaP 提供了一种简单有效的解决方案,用于增强以运动为中心的视频推理,而无需 模型训练 或架构修改。项目页面:https://github.com/SunVictor23/MaP。