论文

Strat-Reasoner:在多智能体博弈中强化LLM的策略推理

Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games

模型训练强化学习Agentic RL

摘要

虽然大语言模型 (LLM) 在某些推理任务中表现出色,但它们在多智能体博弈中表现不佳,其中最终结果取决于所有智能体的联合策略。在多智能体博弈中,其他智能体的非平稳性给推理过程的评估和多个推理步骤的贡献归因带来了重大挑战。现有的单代理强化学习(RL)方法及其多代理扩展无法解决这些挑战,因为它们没有在推理过程中纳入其他代理。在这项工作中,我们提出了 Strat-Reasoner,这是一种基于强化学习的新型框架,可以提高大语言模型在多智能体游戏中的战略推理能力。我们引入了一种新颖的递归推理范式,其中代理的推理还集成了其他代理的推理过程。为了为中间推理序列提供有效的奖励信号,我们采用集中式思想链(CoT)比较模块来评估推理质量。最后,我们计算准确的混合优势,并开发一种与群体相关的 RL 方法来优化 LLM 政策。实验结果表明,Strat-Reasoner 显着提高了底层 LLM 的策略能力,在各种多智能体游戏中实现了 22.1% 的平均性能提升。