论文

DIGHT:以物理反馈后训练人体交互生成器

From Digital Human Interactions to Physics-Based Humanoid Skills: Physics-Grounded Post-Training of Interaction Generators

模型训练应用与实践偏好优化机器人内容创作

摘要

最近的方法在两个类人机器人之间生成交互方面取得了有希望的进展,主要依靠基于物理的跟踪策略将数字参考运动转换为可执行轨迹。然而,有限的跟踪能力限制了可以成功执行的参考运动的范围,从而降低了数据利用率。此外,即使成功的跟踪也不能保证物理上合理的响应或忠实地实现预期的交互。在本文中,我们介绍了 DIGHT,这是一种将数字人类交互生成器与人形跟踪策略相结合的自适应框架。我们的 DIGHT 首先使用固定跟踪器在模拟中执行多个文本条件交互候选。然后,它根据最终的部署构建基于物理的偏好,涵盖一般可执行性和交互保真度。我们没有将这些信号折叠成单个标量奖励来进行候选排名,而是使用物理解耦扩散直接偏好优化(DPO)来对齐预训练的生成器,保留 特定标准的监督,无需通过模拟器进行区分。为了提高可执行性,偏好对是从跟踪误差、摩擦和浮动中导出的。此外,为了提高交互保真度,我们建议将模拟器的力反馈作为接触保真度的衡量标准,并构建对接触发生、位置、持续时间和力大小的偏好。然后,对齐的生成器提供参考运动来微调跟踪器,从而提高生成和物理执行之间的兼容性。大量的实验表明,我们的方法不仅提高了生成运动的物理合理性,而且还能够在模拟中实现更可靠和忠实的人形交互。

DIGHT:以物理反馈后训练人体交互生成器:论文原图
图 2:DIGHT 概述。 DIGHT 由交互生成器和跟踪策略组成,它们分两个阶段共同适应。首先,由生成器产生的多个候选交互由冻结的跟踪器执行,其卷展栏用于构建基于物理的跟踪、摩擦耗散、浮动、接触发生和接触质量的偏好。这些偏好通过物理解耦扩散 DPO 来调整发生器。其次,来自对齐生成器的运动用于调整跟踪策略,提高它们的兼容性。