论文

与人类自适应协作:带持续学习的多智能体LLM元认知策略优化

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

模型训练强化学习RLVRAgentic RL

摘要

在扩展单个大语言模型(LLM)已带来显著进展的同时,下一个前沿在于通过多智能体系统(MAS)扩展协作。然而,纯自主的MAS仍是"封闭世界"系统,受预训练模型静态知识视野的约束。这一局限使其在需要训练数据之外知识的任务上表现脆弱,在全新挑战下常导致集体失败。为解决该问题,我们提出人在回路多智能体协作(HILA)框架,一种有原则的人-智能体协作范式。HILA训练智能体学习元认知策略,决定何时自主解决问题、何时转交人类专家。为将该策略落地,我们提出双回路策略优化(Dual-Loop Policy Optimization),将即时决策与长期能力成长解耦。内回路应用带成本感知奖励的组相对策略优化(GRPO)来优化转交决策,外回路实施持续学习,把专家反馈转化为高质量监督信号以增强智能体推理能力。在有挑战性的数学与问题求解基准上的实验表明,配备双回路策略优化的HILA持续优于先进的MAS,为协作且持续改进的智能体系统奠定了有原则的基础。

与人类自适应协作:带持续学习的多智能体LLM元认知策略优化:论文配图
图 1:拟议的 HILA 框架及其双环策略优化 (DLPO) 训练范例的概述。左:HILA 通过元认知状态和战略行动(评估、创建、延迟),通过主动人类指导和反应性专家反馈来协调多智能体协作。右图:DLPO 通过成本感知奖励来优化内部 RL 循环中的元策略,并通过将 DEFER 触发的人类反馈存储为离线监督来扩展外部持续学习循环中的模型知识边界。