论文
DIGHT:以物理反馈后训练人体交互生成器
From Digital Human Interactions to Physics-Based Humanoid Skills: Physics-Grounded Post-Training of Interaction Generators
摘要
最近的方法在两个类人机器人之间生成交互方面取得了有希望的进展,主要依靠基于物理的跟踪策略将数字参考运动转换为可执行轨迹。然而,有限的跟踪能力限制了可以成功执行的参考运动的范围,从而降低了数据利用率。此外,即使成功的跟踪也不能保证物理上合理的响应或忠实地实现预期的交互。在本文中,我们介绍了 DIGHT,这是一种将数字人类交互生成器与人形跟踪策略相结合的自适应框架。我们的 DIGHT 首先使用固定跟踪器在模拟中执行多个文本条件交互候选。然后,它根据最终的部署构建基于物理的偏好,涵盖一般可执行性和交互保真度。我们没有将这些信号折叠成单个标量奖励来进行候选排名,而是使用物理解耦扩散直接偏好优化(DPO)来对齐预训练的生成器,保留 特定标准的监督,无需通过模拟器进行区分。为了提高可执行性,偏好对是从跟踪误差、摩擦和浮动中导出的。此外,为了提高交互保真度,我们建议将模拟器的力反馈作为接触保真度的衡量标准,并构建对接触发生、位置、持续时间和力大小的偏好。然后,对齐的生成器提供参考运动来微调跟踪器,从而提高生成和物理执行之间的兼容性。大量的实验表明,我们的方法不仅提高了生成运动的物理合理性,而且还能够在模拟中实现更可靠和忠实的人形交互。
