论文
面向多智能体强化学习的自适应鲁棒估计器
Adaptive Robust Estimator for Multi-Agent Reinforcement Learning
摘要
多智能体协作已成为增强大语言模型推理能力的有力范式,但其交互层面的模糊性使生成、批判与修订彼此混淆,导致跨智能体的贡献归因困难。此外,这种设定下的策略优化容易受到重尾和噪声奖励的影响,会使优势估计产生偏差,引发不稳定甚至发散的训练。为同时解决这两个问题,我们提出一个面向协作推理的鲁棒多智能体强化学习框架,由两个组件构成:双智能体回答-批判-重写(Dual-Agent Answer-Critique-Rewrite, DACR)与自适应鲁棒估计器(Adaptive Robust Estimator, ARE)。DACR把推理分解为结构化的三阶段流水线:回答、批判和重写,同时支持对每个智能体给其伙伴表现带来的边际贡献进行显式归因。ARE在多智能体策略优化期间对批量经验均值提供鲁棒估计。在数学推理与具身智能基准上,即便奖励带噪声,我们的方法在同构与异构设定下都稳定优于基线。这些结果表明该方法对奖励噪声具有更强的鲁棒性与更稳定的训练动态,有效防止了噪声奖励信号造成的优化失败。
