论文

大语言模型 协作多智能体强化学习的引导激励感知奖励设计

Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learning

模型训练奖励建模与过程监督

摘要

为协作多智能体系统设计有效的辅助奖励仍然具有挑战性,因为不一致的激励可能会导致协调不佳,特别是当稀疏的任务奖励为协调行为提供不足的基础时。本研究介绍了一种自主奖励设计框架,该框架使用 大语言模型 (LLM) 从环境仪器中合成可执行奖励程序。该过程将候选程序限制在正式的有效性范围内,并在固定的计算预算下使用多代理近端策略优化(MAPPO)从头开始训练策略。然后根据候选者的表现进行评估,并仅根据稀疏任务返回进行跨代选择。该框架在四种 Overcooked-AI 布局中进行了评估,其特点是不同程度的走廊拥堵、切换依赖性和结构不对称。所提出的奖励设计方法始终能够产生更高的任务回报和交付数量,并且在交互瓶颈占主导地位的环境中观察到最明显的收益。对合成的塑造成分的诊断分析揭示了动作选择中更强的相互依赖性以及协调密集型任务中改进的信号对齐。这些结果表明,所提出的 LLM 引导奖励搜索框架减轻了对手动工程的需求,同时产生与有限预算下的合作学习兼容的整形信号。