论文

SignalClaw:LLM引导的可解释交通信号控制技能进化合成

SignalClaw: LLM-Guided Evolutionary Synthesis of Interpretable Traffic Signal Control Skills

智能体系统Agent 环境交互Agent Skills

摘要

交通信号控制(TSC)需要兼顾有效性与可解释性的策略方可部署,然而强化学习产生的是不透明的神经策略,而程序合成又依赖受限的领域专用语言。我们提出SignalClaw,一个以大语言模型(LLM)作为进化式技能生成器的框架,用以为自适应TSC合成并精炼可解释的控制技能。每项技能包含理由说明、选择指引和可执行代码,使策略可供人工审查且自带文档说明。在每一代中,来自排队百分位、延误趋势和停滞等仿真指标的进化信号被转化为自然语言反馈,以指导改进。SignalClaw还引入事件驱动的组合进化:事件检测器通过TraCI识别紧急车辆、公交优先、事故与拥堵,优先级调度器则选择专项技能。每项技能独立进化,优先级链支持在运行时组合技能而无需再训练。我们在常规与注入事件的SUMO场景上,将SignalClaw与四个基线进行对比评估。在常规场景下,其平均延误为7.8至9.2秒,与最优方法差距在3%到10%以内,且跨随机种子方差很低。在事件场景下,它取得最低的紧急车辆延误(11.2至18.5秒,而MaxPressure为42.3至72.3秒,DQN为78.5至95.3秒)和最低的公交人均延误(9.8至11.5秒,而MaxPressure为38.7至45.2秒)。在混合事件中,调度器能有效组合技能,同时保持总体延误稳定。进化出的技能从简单线性规则逐步发展为具有多特征交互的条件策略,同时保持完全可解释,并可供交通工程师直接修改。