论文

基于LLM的分层协调控制与延续感知策略学习

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

模型训练强化学习

摘要

当系统交互难以建模、运行信息异构、且低层动作必须满足严格约束时,协调复杂工程系统中的多个交互单元充满挑战。我们提出一个基于LLM的分层框架,其中LLM基于异构运行上下文协调交互单元,而任务特定的控制器或优化器生成可执行且感知约束的动作。我们进一步引入延续感知GRPO(Continuation-Aware GRPO),以捕捉协调决策在后续控制区间中的后果。该方法不再仅凭即时结果评判决策,还评估系统在当前策略下此后的演化。我们在多匝道交通控制和虚拟电厂(VPP)能源管理上验证该框架,使用简化系统模型训练、更真实的模拟器评估。在两个任务上,所提方法持续优于直接任务特定控制与优化、端到端强化学习、基于规则和基于RL的分层协调以及仅提示的LLM协调器,展示了异构上下文推理、分层执行和延续感知策略学习的价值。

基于LLM的分层协调控制与延续感知策略学习:论文配图
图1:所提出的基于 LLM 的分层协调框架与 Continuation-Aware GRPO 概览。