论文

Event-VLA:用于鲁棒视觉-语言-动作模型的动作条件事件融合

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

摘要

视觉-语言-动作(VLA)模型已成为嵌入式人工智能的重要范例。然而,现有的 VLA 模型通常假设光线充足且稳定的室内环境,而现实世界的具体操作可能会涉及由照明变化引起的 RGB 观察结果的退化,这对稳健的机器人操作提出了严峻的挑战。为了解决这一差距,我们提出了 \textbf{Event-VLA},这是一种事件增强型 VLA 框架,用于跨不同照明条件的通用操作。我们将可见性降低下基于 VLA 的操作制定为以 RGB 为中心的策略的实际鲁棒性问题,并引入事件流作为照明鲁棒、运动敏感的补充观察,以提高跨可见性级别的鲁棒性。具体来说,与直接将事件特征合并到全局语义标记空间的传统多模态融合不同,Event-VLA 通过动作查询路由路径注入事件信息。它使用可学习的动作查询从 VLA 推理过程中提取与任务相关的语义,并通过门控交叉注意力有选择地聚合事件标记以构建事件感知的动作表示。该设计保留了预先训练的 RGB 语言语义先验,同时有效地利用事件信息进行稳健的动作预测。模拟和现实世界部署实验表明,Event-VLA在正常照明下保持了强大的操控性能,并提高了低光衰减和近黑暗现实世界设置下的成功率。