论文

使用语言模型进行细粒度的人体动作理解

Fine-grained Human Motion Understanding with Language Models

模型训练监督微调与指令调优

摘要

在这项工作中,我们提出了 \methodname,一种基于 LLM 的细粒度人体运动理解模型,它将运动表示为一系列骨骼姿势,每个姿势都有明确的时间戳。每个姿势都会对身体关节位置进行编码,并在时间上以时间戳标记为基础,从而使模型能够推理运动顺序、持续时间和节奏。为了研究动作语言推理需要什么监督,我们构建了一个涵盖姿势描述、姿势问答、动作字幕和动作问答的多样化训练混合物。我们的消融表明,主要收益来自姿势和运动级别监督的多样性,而分阶段训练提供了较小的额外收益。与之前依赖 真值 3D 动作捕捉的作品不同,我们的方法通过统一的姿势编码器支持 2D 和 3D 骨骼运动表示,并且可以选择合并视频以提供上下文信息。在 BABEL-QA、HuMMan-QA、CompMo、NTU-RGB+D 和 QEVD-Coach 上进行的大量实验表明,我们的方法在多个基准测试中实现了最先进的性能,突出了显式时间编码以及多种姿势和运动级别监督对于细粒度人体运动理解的有效性。值得注意的是,即使仅使用 2D 骨骼输入,我们的方法也超越了之前基于 3D 的方法。