论文

规则对齐小语言模型与多智能体自校正的闭环控制

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

智能体系统模型训练强化学习Agent 架构与控制循环RLVRAgentic RL

摘要

自主工业运行的关键一步,是能从自然语言需求规格创建并重构控制策略,且极少或无需人工重设计。在此设定下,AI智能体生成控制策略若配上可检查候选动作的被控对象感知验证器(如数字孪生),可以是一条可信路径。但实际部署受推理延迟与算力足迹制约:大型云端模型对边缘闭环使用常太慢、不透明或数据敏感。本工作研究紧凑的小语言模型(SLM)能否经重训掌握控制推理并嵌入验证器引导的纠错回路。我们使用经GRPO对齐的Qwen2.5-1.5B,结合:(i) 动作智能体、(ii) 符号/数字孪生式验证层、(iii) 把输出迭代导向合法动作的重提示智能体。在随机化热控仿真(30个实验、每个500步)中:框架以3.84秒平均推理延迟取得91.5%的平均动作对齐准确率(各案例86.3%–100%);在符号重映射下保持95%的在界率——表明尽管token级一致率下降,物理调节依然鲁棒。结果支持SLM加验证器架构作为边缘可重构自主控制的实用路径。

规则对齐小语言模型与多智能体自校正的闭环控制:论文配图
图 1:代理闭环控制架构示意图。该框架包含用于决策推理(蓝色)的 GRPO 对齐小语言模型(SLM)和用于规则检查的符号验证(橙色)。执行层(绿色)是在收到一个有效的动作后不断更新系统。