论文
MuseVLA:用于机器人操作的自适应多模态传感视觉-语言-动作模型
MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation
摘要
人类自然地利用不同的传感方式与物理世界交互,而大多数机器人视觉-语言-动作 (VLA) 模型仅依赖于 RGB 观察。这限制了它们感知物理属性的能力,而这些物理属性很难或不可能从 RGB 摄像头推断出来,例如温度、声音或雷达响应。我们推出了 MuseVLA,这是一种自适应多模态传感 VLA 模型,它集成了新型传感器作为机器人操作的按需工具。给定任务指令和视觉上下文,MuseVLA 首先生成传感器词元和目标描述,用于选择要调用的传感模式以及要关注的内容,类似于带参数的工具调用。然后,它将选定的传感器测量结果转换为具有感知依据的传感器图像,这是一种统一的中间表示,可对多模态融合和动作生成的异构读数进行编码。该设计将传感器特定处理与 VLA 主干分离,从而实现多种模式的高效集成。为了减少对昂贵的多感官机器人数据集的需求,我们进一步引入了数据合成管道,该管道通过具有感知依据的传感器图像增强现有的 RGB 视频数据集,从而能够泛化到看不见的传感器引导任务。我们在现实世界的机器人上评估 MuseVLA,完成具有挑战性的灵巧手部操作任务,这些任务需要多模态传感输入,包括温度引导的拾取和放置、音频驱动的对象搜索和雷达辅助的隐藏对象检索。 MuseVLA 平均成功率达到 80.6%,显着优于仅 RGB 和多感官 VLA 基线,并且在未见过的任务上表现出强大的零样本能力。代码、模型和数据集可在 https://github.com/microsoft/MuseVLA 获取。