论文
从 3D 姿势到散文:基于生物力学的视觉——语言辅导
From 3D Pose to Prose: Biomechanics-Grounded Vision--Language Coaching
摘要
我们推出了 BioCoach,一个基于生物力学的视觉语言框架,用于通过流视频进行健身指导。 BioCoach 通过新颖的三阶段流程融合了视觉外观和 3D 骨骼运动学:一个专注于显着关节分析的运动特定自由度选择器;结构化的生物力学背景,将个性化形态测量与循环和约束分析相结合;以及一个视觉生物力学条件反馈模块,该模块应用交叉注意力来生成精确的、可操作的文本。 BioCoach 使用冻结视觉和语言骨干的参数高效训练,产生透明、个性化的推理,而不是模式匹配。为了实现学习和公平评估,我们通过面向生物力学的反馈增强了 QEVD-fit-coach,以创建 QEVD-bio-fit-coach,并引入了生物力学感知的 LLM 判断指标。 BioCoach 在词汇和判断指标方面比 QEVD-bio-fit-coach 取得了明显的进步,同时保持了时间触发;在原始的 QEVD-fit-coach 上,它以接近同等的计时提高了文本质量和正确性,表明明确的运动学和约束是准确、阶段感知辅导的关键。