论文
HEX:跨实体全身操纵的人形对齐专家
HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation
摘要
人类通过协调的全身控制来实现复杂的操作,而大多数视觉-语言-动作(VLA)模型很大程度上独立地处理机器人的身体部位,这使得高自由度的人形控制具有挑战性,而且往往不稳定。我们提出了 HEX,一个以状态为中心的框架,用于全尺寸双足人形机器人的协调操作。 HEX 引入了一种与人形一致的通用状态表示,用于跨异构实施例的可扩展学习,并结合了专家混合统一本体感受预测器来根据大规模多实施例轨迹数据对全身协调和时间运动动态进行建模。为了有效地捕获时间视觉上下文,HEX 使用轻量级历史标记来总结过去的观察结果,避免在推理过程中对历史图像进行重复编码。它还采用带有流程匹配动作头的残差门控融合机制,自适应地将视觉语言线索与本体感觉动力学相结合,以生成动作。对现实世界人形操纵任务的实验表明,HEX 在任务成功率和泛化方面实现了最先进的性能,特别是在快速反应和长视野场景中。