论文

DGLight:用于交通信号控制的 大语言模型 的 DQN 引导 GRPO 微调

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

模型训练强化学习

摘要

交通信号控制 (TSC) 在减少拥堵和维持城市交通方面发挥着核心作用。本论文介绍了 DGLight,这是一种评论家引导的强化学习框架,用于将预训练的 大语言模型 应用于 TSC。 DGLight 首先训练基于 CoLight 的深度 Q 网络批评家,从结构化交叉路口状态估计交通感知动作值,然后使用冻结批评家对候选语言模型动作进行评分,并通过组相对策略优化 (GRPO) 优化策略。由此产生的控制器将交通状态映射到可解释的推理轨迹和信号决策,同时从密集的每个状态监督而不是原始累积环境奖励中学习。在涵盖济南和杭州的 TSC 基准测试上进行的实验表明,在基于 LLM 的控制器中,DGLight 是最强的整体方法,与强大的 RL 基线相比仍然具有竞争力,并且可以很好地转移到未用于拟合批评家的城市数据集。定性示例进一步表明,模型生成的推理是可解释的,并且与所选信号相位一致。项目代码可在 $\href{https://github.com/yyccbb/FYP_LLMTSC}{here}$ 获取。