论文

OracleTSC:面向交通信号控制的oracle知情奖励门槛与不确定性正则

OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

模型训练强化学习

摘要

透明的决策制定对交通信号控制(TSC)系统赢得公众信任至关重要。但传统基于强化学习的TSC方法是可解释性有限的黑箱。虽然大语言模型(LLM)能提供自然语言推理,但TSC的强化微调仍不稳定:反馈稀疏且延迟,而多数动作只产生拥堵指标的边际变化。我们引入OracleTSC:经两个机制稳定基于LLM的TSC:(1)奖励门槛机制——从环境奖励中减去校准阈值,过滤弱学习信号;(2)不确定性正则——最大化所选回复的概率,以鼓励跨采样输出的一致决策。LibSignal基准上的实验显示OracleTSC使紧凑的LLaMA3-8B大幅提升交通效率:较预训练基线行程时间降75%、排队长度降67%,同时经自然语言解释保持可解释性。

OracleTSC:面向交通信号控制的oracle知情奖励门槛与不确定性正则:论文配图
图 1:OracleTSC 框架概述。交通状态被转换为 LLM 策略的提示,该策略根据 GG 采样响应生成候选信号相位。拟议的奖励障碍机制(RHM)强调高影响力的行动,而不确定性正则化则惩罚高熵反应。这两个目标在 PPO 框架下共同优化,产生自适应交通信号控制的细化政策。