论文

VLALight:以紧凑 VLA 实时控制应急交通信号

VLALight: Lightweight Vision-Language-Action Models for Emergency-Aware Traffic Signal Control

摘要

交通信号控制 (TSC) 对于缓解城市拥堵至关重要。视觉语言模型 (VLM) 的最新进展可以对交叉口场景进行更丰富的解释,为视觉上下文感知的 TSC 带来新的机会。然而,模块之间的松散耦合和重复的信息转换可能会导致细粒度视觉细节的丢失,而顺序推理会带来大量的延迟。为了解决这些限制,我们提出了 VLALight,这是一种轻量级的端到端视觉语言动作框架,可直接将交叉路口观察和信号相位信息映射到离散信号动作。为了处理 TSC 的多视图特性,VLALight 将多个定向摄像机视图组合成统一的视觉输入,并使用文本指令建立它们与交通运动和信号相位的对应关系。该设计可通过紧凑的 0.5 B 参数模型实现直接动作预测,无需中间图像到文本描述或手工制作的交通状态表示。实验表明,VLALight 提供了所有比较方法中最好的紧急车辆服务,与级联 VLMLight 相比,汇总应急车辆等待时间减少了 21.1%,同时在本地硬件上实时运行,并推广到不可见的交叉路口拓扑和交通流模式。

VLALight的仿真交通数据生成、后训练和视觉语言动作推理架构。
图2(图注摘要):VLALight的仿真交通数据生成、后训练和视觉语言动作推理架构。