论文
RE-VLM:用于场景理解的事件增强视觉语言模型
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
摘要
传统的视觉语言模型 (VLM) 很难解释在不利条件下(例如低光照、高动态范围或快速运动)捕获的场景,因为标准 RGB 图像在此类环境中会退化。事件摄像机提供了一种补充模式:它们以高时间分辨率和宽动态范围异步记录每像素亮度变化,在帧失败时保留运动线索。我们提出 RE-VLM,这是第一个双流视觉语言模型,它联合利用 RGB 图像和事件流,在正常和具有挑战性的条件下实现强大的场景理解。 RE-VLM 采用并行 RGB 和事件编码器以及渐进式训练策略,使异构视觉特征与语言保持一致。为了解决 RGB-Event-Text 监督的稀缺性,我们进一步提出了一种图形驱动的管道,将同步的 RGB-Event 流转换为可验证的场景图,从中我们合成标题和问答(QA)对。为了开发和评估 RE-VLM,我们构建了两个数据集:PEOD-Chat(针对光照困难的场景)和 RGBE-Chat(涵盖不同的场景)。在字幕和 VQA 基准测试中,RE-VLM 在参数数量相当的情况下始终优于最先进的纯 RGB 模型和纯事件模型,并且在具有挑战性的条件下具有特别大的增益。这些结果证明了事件增强 VLM 在广泛的现实环境中实现稳健的视觉语言理解方面的有效性。