论文

ReasonLight:用于零样本交通信号控制的多模态基础模型增强型强化学习框架

ReasonLight: A Multimodal Foundation Model-Enhanced Reinforcement Learning Framework for Zero-Shot Traffic Signal Control

应用与实践行业应用

摘要

强化学习 (RL) 在交通信号控制 (TSC) 领域展现出了良好的前景。然而,它对预定义状态的依赖限制了对训练数据中缺少的可观察开放世界事件的响应能力。支持物联网的十字路口提供来自路边传感器和摄像头的异构观测,为提高强化学习对此类事件的适应性创造了机会。为此,我们提出了 ReasonLight,一种用于零样本 TSC 的多模态基础模型增强 RL 框架。 ReasonLight 集成了三个信息源:结构化流量测量、多视图摄像机观察以及来自预训练 RL 控制器的候选阶段决策。给定 RL 提出的阶段,ReasonLight 从多视图图像中提取视觉语义,并将它们与紧凑的传感器衍生场景描述对齐。这种对齐使语义引导的细化模块能够根据交通规则和事件语义保留或调整建议的操作。为了确保操作可靠性,精细的操作受到可用阶段集的限制。任何无效的决策都会被拒绝,系统会退回到原来的 RL 操作。我们针对 RL 训练期间未见过的两类罕见事件评估 ReasonLight:紧急车辆优先和临时交通管制。实验结果表明,ReasonLight无需重新训练即可实现零样本自适应。与仅 RL 骨干网相比,它可将紧急车辆等待时间减少高达 88.7%,同时保持可比较的常规交通性能。