论文
Dynin-Robotics:全模态统一扩散视觉-语言-动作模型
Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
摘要
视觉目标和动态预测可以为语言调节的机器人策略提供目标结果和动作相关场景变化的表示。我们通过共享轨迹模型将这些预测带入行动生成和选择中。 Dynin-Robotics 在 Dynin-Omni 上实现了这一公式,Dynin-Omni 是一个全模态掩蔽扩散主干,将语言、视觉观察、目标和动作表示为离散标记。通过改变条件和目标跨度,同一模型可以学习动作预测、动作条件下一次观察预测、最终目标状态预测和轨迹到指令重建。这些接口通过目标预测、候选动作评估以及动作和未来状态预测的联合细化来支持测试时间扩展。我们不断在来自 48 个 Open X-Embodiment 数据集的约 133 万条轨迹上对模型进行预训练,并将其单独适应下游领域。在两个 VLABench 任务中,机器人预训练提高了固定 Stage-2 步骤预算内的适应能力,并且与同一耦合解码器下的仅策略后训练相比,完整目标混合提高了移位指令的成功率。将目标引导与联合动作下一状态去噪相结合,进一步提高了移位指令相对于仅动作解码的成功率;好处取决于预测的构成方式。 Dynin-Robotics 在 LIBERO 和零次 LIBERO-Plus 上实现了具有竞争力的性能,并且在 Franka Research 3 机器人上的四种操作条件下平均成功率为 78.4%。相对于所报告的分析设置下的基本实现,优化的块并行实现可将模型端动作解码速度提高高达 29.2 倍。这些结果支持共享轨迹建模作为学习互补机器人目标并在控制过程中进行预测的通用接口。