论文
双语文本到动作生成:新的基准和基线
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
摘要
文本到动作的生成对于跨语言应用具有巨大的潜力,但由于缺乏双语数据集和现有语言模型的跨语言语义理解较差而受到阻碍。为了解决这些差距,我们引入了 BiHumanML3D,这是第一个双语文本到运动基准,通过 LLM 辅助注释和严格的手动校正构建。此外,我们提出了一个简单而有效的基线,双语运动扩散(BiMD),其特点是跨语言对齐(CLA)。 CLA 明确地调整了跨语言的语义表示,创建了一个强大的条件空间,可以从双语输入生成高质量的运动,包括零样本代码切换场景。大量实验表明,带有 CLA 的 BiMD 的 FID 为 0.045 vs. 0.169,R@3 为 82.8\% vs. 80.8\%,显着优于 BiHumanML3D 上的单语言扩散模型和翻译基线,强调了我们数据集的关键必要性和可靠性以及我们跨语言运动合成对齐策略的有效性。数据集和代码发布于\href{https://wengwanjian.github.io/BilingualT2M-page}{https://wengwanjian.github.io/BilingualT2M-page}