论文
BoT-Feedback:以生物力学证据支撑多模态动作反馈
BoT-Feedback: Grounding Multimodal Reasoning in Biomechanical Evidence for Explainable Human Action Feedback
摘要
多模态大语言模型 (MLLM) 在视觉理解和多模态推理方面表现出了令人印象深刻的能力,但它们在人类动作反馈生成方面仍然受到根本限制。现有的方法直接从视觉观察中推断教练反馈,产生通用建议、有限的可解释性和物理上难以置信的幻觉。相比之下,专业的人类教练通过对关节运动学、姿势和身体动力学的明确生物力学推理来诊断表现。我们引入了 BoT-Feedback,这是一个将 MLLM 推理建立在结构化生物力学证据基础上的框架。我们的主要贡献是思想生物力学 (BoT),这是一个四阶段推理框架,可逐步识别动作、定位关键身体区域、分析专家和 学员 表现之间的定量生物力学差异,并综合可解释的教练反馈。为了支持这个推理过程,我们开发了一个即插即用的生物力学数据解析器(BDP),它将视频转换为结构化的生物力学描述符,以及一种在时间上对齐专家和 学员 运动的对齐策略。我们进一步介绍 BiomAF,这是一个包含配对 教练-学员 视频、3D 骨架、生物力学属性和专家指导注释的基准。十二个开源和闭源 MLLM 的实验表明,生物力学证据中的基础推理持续提高反馈质量、可解释性和鲁棒性,同时大幅减少生物力学幻觉。 BoT-Feedback 将平均专家评估分数从 2.07 提高到 2.95 (+40%),使紧凑型开源 MLLM 能够接近更大的专有系统的性能,以生成可解释的动作反馈。
