论文
用于文本驱动的 3D 手部动作生成的师生扩散模型
Teacher-Student Diffusion Model for Text-Driven 3D Hand Motion Generation
摘要
从自然语言生成逼真的 3D 手部动作对于 VR、机器人和人机交互至关重要。现有方法要么专注于全身运动,忽略详细的手势,要么需要显式的 3D 对象网格,从而限制了通用性。我们提出了 TSHaMo,一种与模型无关的师生扩散框架,用于文本驱动的手部动作生成。学生模型学习仅从文本合成运动,而教师则利用辅助信号(例如 MANO 参数)在训练期间提供结构化指导。协同训练策略使学生能够从教师的中间预测中受益,同时在推理时保持纯文本。使用 GRAB 和 H2O 上的两个扩散主干进行评估,TSHaMo 持续提高运动质量和多样性。消融证实了其在使用不同辅助输入方面的稳健性和灵活性,而在测试时不需要 3D 对象。