论文
OracleTSC:面向交通信号控制的oracle知情奖励门槛与不确定性正则
OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control
摘要
透明的决策制定对交通信号控制(TSC)系统赢得公众信任至关重要。但传统基于强化学习的TSC方法是可解释性有限的黑箱。虽然大语言模型(LLM)能提供自然语言推理,但TSC的强化微调仍不稳定:反馈稀疏且延迟,而多数动作只产生拥堵指标的边际变化。我们引入OracleTSC:经两个机制稳定基于LLM的TSC:(1)奖励门槛机制——从环境奖励中减去校准阈值,过滤弱学习信号;(2)不确定性正则——最大化所选回复的概率,以鼓励跨采样输出的一致决策。LibSignal基准上的实验显示OracleTSC使紧凑的LLaMA3-8B大幅提升交通效率:较预训练基线行程时间降75%、排队长度降67%,同时经自然语言解释保持可解释性。
