论文
MotionAtlas:以运动为中心的视频的详细区域字幕
MotionAtlas: Detailed Region Captioning for Motion-Centric Videos
摘要
我们提出了 MotionAtlas,一个用于以运动为中心的视频的详细字幕的系统,包括 (1) 专用的人工注释基准,(2) 用于构建训练样本的可扩展的高质量管道,以及 (3) 一系列强大的视频 MLLM。与传统的全局运动字幕数据集不同,我们专注于区域感知运动字幕:给定视频和时空掩模,该模型生成目标区域内运动的精确描述,从而减轻视觉混乱和运动纠缠,并实现可靠、可量化的评估。具体来说,我们首先构建了 MotionAtlas-Bench,这是一个包含 2,073 个多项选择题的综合基准测试,针对一组精选的高质量、以运动为中心的视频进行了精心注释,以评估对相关对象的细粒度运动理解。其次,我们设计了一个严格且可扩展的数据管道,利用自引导细化来抑制细粒度的幻觉,产生 159k 高质量的运动字幕数据。第三,我们设计了定制的训练数据组合策略,该策略在不同的基线 Video-MLLM(包括 Molmo2 和 Qwen3-VL)中实现了一致且显着的性能提升。例如,在一般运动基准测试中,MotionAtlas-4B 比 Qwen3-VL-4B 平均高出 5.2 个百分点。基准测试、数据集和代码已发布。