论文
FitAQA:面向多模态大语言模型的健身动作质量评估基准
FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models
摘要
健身动作质量评估(AQA)对智能运动训练十分重要,但多模态大语言模型(MLLM)在此场景下的能力仍待探索。现有基准依赖动作特定的标注方案,主要关注最终评估输出,对模型如何评估动作质量洞察有限。我们提出FitAQA,一个系统评估MLLM健身AQA能力的基准,包含2,219个视频与5,512个问答实例,覆盖30种自重训练动作。我们与运动科学专家合作,建立统一的形态错误分类法,在六个互补质量维度(对齐、对称、稳定、协调、节奏与完整)下定义38种常见形态错误。该分类法为不同动作提供共享的评估框架。FitAQA进一步设计三个评估任务:感知(识别相关视觉证据)、判断(将该证据与领域知识结合以评估动作正确性)和时序定位(在时间上定位形态错误)。大量评估表明,当前MLLM仍难以全面评估动作质量并精确定位形态错误。受控实验进一步指出视觉感知是关键瓶颈:提供真值感知证据后,判断性能显著提升。数据集见 https://huggingface.co/datasets/Kelly0510/FitAQA。
