论文
一个冻结的模拟器是不够的:多智能体强化学习中的模拟器崩溃
One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
摘要
用于人机交互的多智能体强化学习通常依赖于单个 大语言模型 来模拟用户行为。我们表明,这种方法系统地无法泛化,并将失败追溯到模拟器崩溃:因为模拟器 LLM 是模式崩溃的,所以针对它训练的 LLM 策略会过度适应利用模拟器主导模式的狭窄策略,并且这种策略很难转移到看不见的模拟器和真实用户。我们从理论上形式化了这种崩溃,并提出了两种互补的解决方案,一种在推理时,一种在训练时。推理时解决方案“语言化采样”通过从语言化响应分布中采样来扩展模拟器的行为,从而减少模式崩溃。训练时解决方案 Co-Training 联合优化了针对可训练模拟器群体的策略,防止其过度拟合任何单个模拟器的模式。我们在三个多回合基准测试上验证了这两种解决方案:Persuasion for Good、$τ^2$-bench 和 CooperBench。与单模拟器 RL 相比,语言化采样将保留成功率提高了 9%,而协同训练将收益进一步提升至 14%;人体研究显示真实用户也能获得类似的收益。这两种解决方案都保留了在单模拟器强化学习下崩溃的策略多样性。为了支持这个方向的进一步工作,我们发布了 SCOPE,一个用于群体协同训练多智能体强化学习的开源框架。更广泛地说,我们的结果表明,训练环境的多样性(而不仅仅是政策)对于将多轮强化学习推广到现实世界的部署至关重要。