论文

零门控语言条件人体运动预测

Zero-Gated Language-conditioned Human Motion Prediction

应用与实践视觉感知与空间理解

摘要

姿势历史为 3D 人体运动预测提供了核心运动学证据,但它们缺乏明确的高级语义指导。本文介绍了 ZGL,一种轻量级的语言条件预测器,它使用观察到的运动描述作为语义先验,同时保留强大的运动主干作为动态的主要来源。我们仅渲染观察到​​的姿势,使用视觉语言模型生成一个句子描述,使用冻结的 CLIP-L 文本塔对标题进行编码,并将其投影到一小组条件标记中。这些标记通过具有零门的紧凑交叉注意适配器注入到基于 DCT 的时空 Transformer 中:每个适配器输出乘以初始化为零的可学习门,因此整个网络在初始化时在数值上与仅姿势基线相同,并且只有在减少预测误差时才能学习使用语言。在 Human3.6M 上,ZGL 在我们的比较中相对于代表性运动预测基线改进了整体 MPJPE。 CMUMocap 的结果进一步表明,紧凑的字幕调节转移到第二个基准,并为 3D 人体运动预测提供实用的语义线索。