论文
RLDX-1技术报告
RLDX-1 Technical Report
摘要
虽然视觉语言动作模型(VLA)通过从预先训练的视觉语言模型继承的多功能智能(即广泛的场景理解和语言条件泛化)在类人通用机器人策略方面取得了显着进展,但它们仍然难以应对需要更广泛功能能力(例如运动意识、长期记忆和物理感知)的复杂现实世界任务。为了解决这个问题,我们引入了 RLDX-1,这是一种基于多流操作 Transformer (MSAT) 的通用机器人策略,用于灵巧操作,该架构通过特定于模态的流与跨模态联合自注意力来集成异构模态,从而统一了这些功能。 RLDX-1 进一步将该架构与系统级设计选择相结合,包括罕见操作场景的数据合成、专门用于类人操作的学习程序以及实时部署的推理优化。通过实证评估,我们表明 RLDX-1 在模拟基准测试和需要超越通用性的广泛功能的实际任务中始终优于最新的前沿 VLA(例如 $π_{0.5}$ 和 GR00T N1.6)。特别是,RLDX-1 在 ALLEX 类人任务中表现出优越性,成功率达到 86.8%,而 $π_{0.5}$ 和 GR00T N1.6 的成功率约为 40%,凸显了 RLDX-1 在不同功能需求下控制高自由度类人机器人的能力。总之,这些结果使 RLDX-1 成为实现可靠 VLA 的有希望的一步,用于复杂、接触丰富、动态的现实世界灵巧操作。