论文
CoRE-VLA:通过专家的条件路由实现可扩展且稳健的视觉-语言-动作建模
CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts
摘要
视觉-语言-动作(VLA)模型具有先进的通用机器人操作,但现实世界的部署揭示了一个根本性的挑战:机器人配备了多样化和异构的传感器配置,辅助传感器在操作过程中可能会意外故障,并且不同的机器人实施例通常在设计上缺乏某些传感器。因此,一个统一的策略对于实际部署来说至关重要,该策略可以在可用时利用辅助感知输入,同时在传感器缺失的情况下保持可靠(无论是偶然的还是故意的)。然而,现有的 VLA 策略通过共享密集计算将动作生成与固定传感器集耦合起来,当传感器丢失时,它们会变得脆弱,并限制它们专门处理不同任务和长期行为的能力。我们提出了 CoRE-VLA,这是一个可扩展且强大的 VLA 框架,它将动作生成制定为上下文条件稀疏计算。传感器可用性门控模态专业专家,无需重新培训即可在缺少传感器的情况下实现平稳降级。任务意图进一步将行动方表示传递给与任务相关的专家,从而提高跨不同任务和长期子目标的专业化。虽然该框架旨在容纳不同的辅助传感器,但我们在实验中将深度作为具有代表性和实际重要的辅助模式。在 LIBERO、RoboCasa GR1 Tabletop 和现实世界的双臂操作上进行的实验表明,CoRE-VLA 在长视野和多任务基准上取得了出色的结果,并且优于密集动作生成器消融和强大的预训练 VLA 基线,包括在对未见场景的零样本泛化方面。模态分析表明,CoRE-VLA 可以在可用时利用辅助深度,同时在部署期间深度不可用时保持鲁棒性。