论文
LLM-ALSO:LLM驱动的自适应学习信号优化,用于多代理强化学习
LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning
摘要
有效的训练时间指导是多智能体强化学习(MARL)的核心,但在稀疏奖励环境中仍然很困难,因为薄弱的监督限制了协调和政策改进,并且现有方法通常需要大量的领域专业知识或手动设计工作。 大语言模型 (LLM) 为灵活的学习信号设计提供了一种有前景的替代方案,但现有的基于 LLM 的方法在很大程度上仍然是面向单代理、一次性的,或者对于合作 MARL 不断发展的训练动态的验证很弱。为了解决这些限制,我们提出了 LLM-ALSO,这是一种迭代 LLM 驱动的 MARL 自适应学习信号优化框架。 LLM-ALSO 不是直接部署 LLM 生成的奖励,而是将适应分解为迭代诊断、提议和验证:批评者 LLM 从稀疏返回指标和紧凑行为证据中诊断阶段特定的学习和协调失败,生成器 LLM 提出以诊断为条件的候选奖励塑造配置,分支验证反馈完善候选者在它们影响主要训练轨迹之前。通过短期验证和阶段感知适应,LLM-ALSO 仅将经过验证的更新推广到训练中,从而降低了 LLM 生成的修改不可靠的风险。稀疏奖励协作 MARL 任务的实验表明,LLM-ALSO 提高了稀疏评估性能和学习效率。