论文

ProcessLight:面向大语言模型交通信号控制的过程监督

ProcessLight: Process Supervision for Large Language Model Based Traffic Signal Control

模型训练强化学习Agentic RL

摘要

大语言模型(LLM)因能生成人类可读的推理,近来作为决策Agent被引入交通信号控制(TSC)。然而,现有LLM TSC方法仅从最终结果优化,无法区分有效与有缺陷的推理步骤,导致有用与误导性步骤被一并更新,损害模型对有效推理的学习。为弥合这一缺口,我们提出基于LLM的框架ProcessLight,将信号决策分解为可验证的语义步骤。在此基础上,我们进一步提出逐步交通过程策略优化(STeP-PO),一种通过步骤级信用分配优化结构化推理过程的新型强化学习框架。具体而言,STeP-PO用步骤质量分数评估局部推理质量,用步骤重要性衡量每步对最终行动的影响,进而在语义步骤树结构上分配步骤级优势。所得步骤级优势传播到推理token,实现超越纯结果奖励的细粒度策略优化。在多个真实世界数据集上的大量实验证明了方法的优越性。代码见该网址。

ProcessLight:面向大语言模型交通信号控制的过程监督:论文配图
图1:结果级监督无法有效区分交通信号推理过程中正确和错误的推理步骤,削弱了模型学习正确推理的能力。