论文
TACD:终端放大控制蒸馏的高效文本到动作模型
TACD: Distilling Efficient Text-to-Motion Models via Terminal Amplification Control
摘要
近期文本到动作模型改善了动作质量与指令遵循,但多步去噪与庞大的模型组件使部署缓慢且内存密集。我们提出终端放大控制蒸馏(TACD):一种在线策略方法,从文本提示与预训练教师训练高效动作生成器,无需真实动作训练数据。在分段在线流蒸馏基础上,我们沿学生生成轨迹监督干净动作预测。我们识别出一个失败模式:固定监督网格上的速度匹配反复过度加权去噪端点附近的误差,退化少步生成。TACD把最新教师查询与学生步长绑定,在不改变推理的情况下约束干净动作空间中的有效损失权重。HumanML3D与KIT-ML实验展示少步生成改善,包括八步HY-Motion学生FID相对无此约束蒸馏降低58%。对扩散教师,TACD的端点匹配形式产出四步学生:FID更低、文本-动作检索持平或改善(相对其50步教师,HumanML3D)。HY-Motion与Kimodo上,八步紧凑学生实现7.7-11.9倍端到端加速、峰值GPU内存较教师降低3.8-6.7倍。代码/项目页:https://vkgo.github.io/TACD/。