论文
视觉语言模型能判断动作质量吗?实证评估
Can Vision Language Models Judge Action Quality? An Empirical Evaluation
摘要
动作质量评估(AQA)在物理治疗、运动教练和竞技裁判方面有着广泛的应用。尽管视觉语言模型 (VLM) 对 AQA 具有很大的前景,但它们在该领域的实际表现在很大程度上仍然未知。我们对跨活动领域(例如健身、花样滑冰、跳水)、任务、表示和提示策略的最先进的 VLM 进行了全面评估。基线结果显示,Gemini 3.1 Pro、Qwen3-VL 和 InternVL3.5 模型的表现仅略高于随机机会,尽管整合骨架信息、基础指令、推理结构和情境学习等策略带来了孤立的收益,但没有一个策略始终有效。对预测分布的分析揭示了两种系统偏差:无论视觉证据如何都预测正确执行的倾向,以及对肤浅语言框架的敏感性。相比之下,重新制定任务以减轻这些偏差的效果微乎其微,这表明模型的局限性超出了这些偏差,指出了细粒度运动质量评估的根本困难。我们的研究结果为未来基于 VLM 的 AQA 研究建立了严格的基线,并为在可靠的实际部署之前需要缓解的故障模式提供了可行的大纲。