论文
MotionRFT:用于文本到动作生成的统一强化 微调
MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation
摘要
文本到动作的生成随着基于扩散和流的生成模型的发展而进步,但有监督的预训练仍然不足以使模型与语义一致性、真实性和人类偏好等高级目标保持一致。现有的 后训练 方法具有关键局限性:它们(1)针对特定的运动表示,例如关节,(2)优化特定方面,例如文本运动对齐,并且可能会损害其他因素; (3) 产生大量的计算开销、数据依赖性和粗粒度优化。我们提出了一个强化 微调 框架,其中包括异构表示、多维奖励模型 MotionReward 和高效、细粒度的 微调 方法 EasyTune。为了获得统一的语义表示,MotionReward将异构运动映射到以文本为锚定的共享语义空间,从而实现多维奖励学习;自我完善偏好学习进一步增强语义,无需额外注释。为了高效且有效的 微调,我们将去噪步骤之间的递归梯度依赖性确定为关键瓶颈,并提出 EasyTune,它可以逐步优化而不是在整个轨迹上进行优化,从而产生密集、细粒度和内存高效的更新。大量实验验证了我们框架的有效性,MLD 模型在 22.10 GB 峰值内存下实现了 FID 0.132,并比 DRaFT 节省了高达 15.22 GB 的空间。它在基于关节的 ACMDM 上将 FID 降低了 22.9%,在基于旋转的 HY Motion 上实现了 12.6% 的 R 精度增益和 23.3% 的 FID 改进。我们的项目页面和代码是公开的。