论文

VLALight:用于交通信号控制的视觉-语言-动作模型

VLALight: A Vision-Language-Action Model for Traffic Signal Control

应用与实践模型训练强化学习结构化分析、预测与决策Agentic RL

摘要

交通信号控制 (TSC) 对于改善城市交通和减少拥堵至关重要。尽管路边摄像头广泛部署在信号交叉口并提供对不断变化的交通的丰富视觉观察,但现有的 TSC 方法通常依赖于手动设计的交通状态或单独的感知模块,从而在物理观察和控制决策之间造成了差距。我们rollout了 VLALight,这是第一个用于通过多视图路边视频进行端到端交通信号控制的视觉-语言-动作 (VLA) 模型。 VLALight 通过多目标时空交通推理和交叉路口的拓扑感知协作感知,直接将视觉观察映射到协调的信号动作。为了建立这种能力,我们开发了一种用于视觉交通理解和信号决策的两阶段监督冷启动训练策略,然后是合作的 Agentic 强化学习,共同优化本地控制和网络范围的交通效率。此外,VLALight 引入了自适应快速和慢速推理模式,使策略仅在额外的审议提供足够的控制优势时才能分配更深入的推理。通过平衡模式感知部署和相对优势优化,VLALight 学会在决策质量和推理成本之间进行权衡。对三个城市网络的七个真实交通流量数据集进行的广泛实验表明,VLALight 始终优于基于交通、基于 RL 和基于 LLM/VLM 的基线。消融研究验证了协作感知、网络级优化和自适应推理的有效性。这些结果证明了 VLA 模型在现实世界物理交通控制中的潜力。我们的项目可在 https://github.com/usail-hkust/VLALight.git. 获取