论文

HumanMoveVQA:视频 MLLM 能否推断视频中的人体运动?

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

模型评测基准与评测资源

摘要

尽管多模态 大语言模型 (MLLM) 在高级视频理解方面取得了快速进展,但一个基本瓶颈仍然存在:这些模型将复杂的人体运动分解为粗略的语义标签。现有的基准主要关注以场景为中心的事件或局部关节关节,无法探测随着时间的推移在空间中的全局人体运动(轨迹和方向的变化)。我们推出了 HumanMoveVQA,这是第一个综合基准测试,旨在从外心角度评估全局轨迹和方向推理。我们的基准测试使用第一帧锚定世界坐标系,保留相对于固定起点的平移和旋转。我们提出了一种可扩展的多级管道,可将 2D 视频观察提升为世界一致的 3D 运动轨迹,从而在七个推理类别中生成超过 10K 个结构化问答对,包括运动聚合、顺序排序和轨迹级推理。我们的广泛评估揭示了在深度人体运动理解方面最先进的专有模型的关键能力差距。然而,我们证明这是一个可以学习的问题;通过 微调 开源基线,通过我们有针对性的、世界一致的监督,我们取得了显着的进步。 HumanMoveVQA 为开发下一代运动感知视频理解模型奠定了严格的几何基础。