论文
E-VLA:黑暗和模糊场景的事件增强视觉语言动作模型
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
摘要
机器人视觉-语言-动作 (VLA) 模型对于开放式操作具有很好的泛化能力,但它们的感知在传感阶段退化(例如极弱光、运动模糊和黑色剪裁)下很脆弱。我们提出了 E-VLA,这是一种事件增强的 VLA 框架,当传统的基于框架的视觉变得不可靠时,它可以提高操作的鲁棒性。 E-VLA 不是从事件中重建图像,而是直接利用事件流中的运动和结构线索来在不利条件下保持语义感知和感知-动作一致性。我们使用 DAVIS346 事件相机构建了一个开源远程操作平台,并收集了跨不同任务和照明的真实世界同步 RGB 事件动作操作数据集。我们还提出了轻量级、预训练兼容的事件集成策略,并研究事件窗口以实现稳定部署。实验表明,即使是简单的无参数融合,即将累积的事件图叠加到 RGB 图像上,也可以显着提高黑暗和严重模糊场景中的鲁棒性:在 20 勒克斯的拾取位置上,通过叠加融合,成功率从 0%(仅图像)增加到 60%,通过我们的事件适配器提高到 90%;在严重的运动模糊(1000 毫秒曝光代理)下,拾取位置从 0% 提高到 20-25%,排序从 5% 提高到 32.5%。总体而言,E-VLA 提供了系统证据,表明事件驱动的感知可以有效地集成到 VLA 模型中,指向超越传统基于帧的成像的强大的体现智能。代码和数据集将在 https://github.com/JJayzee/E-VLA 提供。