论文
在身体移动之前:学习语言条件人形控制的预期联合意图
Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control
摘要
自然语言是人形机器人的直观界面,但流式全身控制需要现在可执行且可预测未来物理转换的控制表示。现有的语言条件人形系统通常会生成低级跟踪器必须反应性修复的运动学参考,或者使用潜在/动作策略,其输出不会明确编码即将到来的接触变化、支持转移和平衡准备。我们提出 \textbf{DAJI} (\emph{Dynamics-Aligned Joint Intent}),一个分层框架,用于学习语言生成和闭环控制之间的预期联合意图接口。 DAJI-Act 通过学生驱动的部署,将具有未来意识的教师提炼为可部署的扩散行动策略,而 DAJI-Flow 自回归则从语言和意图历史中生成未来意图块。实验表明,DAJI 在预期潜在学习、单指令生成和流指令跟踪方面取得了强劲的成果,在 HumanML3D 式生成上达到 94.42% 的采样轨迹成功率,在 BABEL 上达到 0.152 子序列 FID。