论文

通过结构化运动描述实现无编码器人体运动理解

Encoder-Free Human Motion Understanding via Structured Motion Descriptions

上下文与知识上下文工程

摘要

基于文本的 大语言模型 (LLM) 的世界知识和推理能力正在迅速发展,但当前的人类运动理解方法,包括运动问答和字幕,尚未充分利用这些能力。现有的基于 LLM 的方法通常通过专用编码器学习运动语言对齐,该编码器将运动特征投影到 LLM 的嵌入空间中,但仍然受到跨模式表示和对齐的约束。受生物力学分析的启发,关节角度和身体部位运动学长期以来一直作为人类运动的精确描述语言,我们提出了 \textbf{结构化运动描述(SMD)},这是一种基于规则的确定性方法,可将关节位置序列转换为关节角度、身体部位运动和全局轨迹的结构化自然语言描述。通过将运动表示为文本,SMD 使 LLM 能够将其预训练的身体部位、空间方向和运动语义知识直接应用于运动推理,而不需要学习编码器或对齐模块。我们表明,这种方法在运动问答(BABEL-QA 上为 66.7%,HuMMan-QA 上为 90.1%)和运动字幕(HumanML3D 上的 R@1 为 0.584,CIDEr 为 53.16)方面都超越了最先进的结果,超越了所有先前的方法。 SMD 还提供了实际的好处:相同的文本输入可以在不同的 LLM 上工作,仅需要轻量级 LoRA 适配(在 6 个模型系列的 8 个 LLM 上进行了验证),并且其人类可读的表示可以对运动描述进行可解释的注意力分析。代码、数据和预训练的 LoRA 适配器可在 https://yaozhang182.github.io/motion-smd/ 获取。