论文
与人类自适应协作:带持续学习的多智能体LLM元认知策略优化
Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
摘要
在扩展单个大语言模型(LLM)已带来显著进展的同时,下一个前沿在于通过多智能体系统(MAS)扩展协作。然而,纯自主的MAS仍是"封闭世界"系统,受预训练模型静态知识视野的约束。这一局限使其在需要训练数据之外知识的任务上表现脆弱,在全新挑战下常导致集体失败。为解决该问题,我们提出人在回路多智能体协作(HILA)框架,一种有原则的人-智能体协作范式。HILA训练智能体学习元认知策略,决定何时自主解决问题、何时转交人类专家。为将该策略落地,我们提出双回路策略优化(Dual-Loop Policy Optimization),将即时决策与长期能力成长解耦。内回路应用带成本感知奖励的组相对策略优化(GRPO)来优化转交决策,外回路实施持续学习,把专家反馈转化为高质量监督信号以增强智能体推理能力。在有挑战性的数学与问题求解基准上的实验表明,配备双回路策略优化的HILA持续优于先进的MAS,为协作且持续改进的智能体系统奠定了有原则的基础。
