论文
NextMotionQA:使用视觉语言模型对人体运动理解进行基准测试和判断
NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models
摘要
对人类运动理解的可靠评估是推进具体人工智能、机器人和动画的基础。然而,现有的基准测试存在语义粒度粗糙、难度无差别、注释质量有限以及普遍存在的答案模糊性等问题,导致它们无法诊断当前模型的失败之处。为了弥补这一差距,我们引入了 NextMotionQA,这是一个综合基准测试,利用视觉语言模型 (VLM) 来实现半自动化、专家验证的数据集。 NextMotionQA 具有三个互补的任务:多项选择题回答、视频字幕和细粒度纠错。每个任务都系统地构建在三个核心语义轴上,并分为三个任务复杂性级别。我们对 12 个具有代表性的 VLM 进行了广泛的评估,发现了在传统的单任务评估中仍然看不见的关键能力差距和弱点。在一个互补的方向上,最近的工作已经开始使用 VLM 作为文本到动作评估的法官;我们询问他们在更艰巨的任务下是否表现出同样的退化。我们发现 VLM 与粗略标准的专家评级高度一致(科恩的 κ = 0.70),但在细粒度、部分级别的判断(κ = 0.10)上却崩溃了,在其强大的体系中验证了范式,同时澄清了其局限性。