论文

MoCHA:用于运动文本检索的去噪描述监督

MoCHA: Denoising Caption Supervision for Motion-Text Retrieval

模型训练合成数据

摘要

文本运动检索系统通过对比目标从运动标题对中学习共享嵌入空间。然而,每个标题不是确定性标签,而是来自有效描述分布的样本:不同的注释器为相同的运动生成不同的文本,将运动可恢复语义(动作类型、身体部位、方向性)与注释器特定的样式和推断的上下文混合在一起,而这些注释器特定的样式和推断的上下文无法单独从 3D 关节坐标确定。标准对比训练将每个标题视为单个正目标,忽略了这种分布结构并引起运动内嵌入方差,从而削弱了对齐。我们提出了 MoCHA,一种文本规范化框架,它通过在编码之前将每个标题投影到其运动可恢复内容上来减少这种方差,从而产生更紧密的正簇和更好分离的嵌入。规范化是一个普遍原则:即使是基于规则的确定性方法也能改善跨数据集传输,尽管学习的规范化器提供了更大的增益。我们提出了两种学习变体:基于 LLM 的方法 (GPT-5.2) 和在推理时不需要 LLM 的精炼 FlanT5 模型。 MoCHA 作为与任何检索架构兼容的预处理步骤运行。应用于 MoPa (MotionPatches) 时,MoCHA 在 HumanML3D (H) 和 KIT-ML (K) 上都创下了新的技术水平:LLM 变体在 H (+3.1pp) 上实现了 13.9% T2M R@1,在 K (+10.3pp) 上实现了 24.3%,而不含 LLM 的 T5 变体则实现了+2.5pp 和 +8.1pp。规范化将运动内文本嵌入方差减少了 11-19%,并显着改善了跨数据集传输,其中 H 到 K 提高了 94%,K 到 H 提高了 52%,这表明标准化语言空间可以产生更可传输的运动语言表示。