论文

MLREF:通过 大语言模型 强化学习中奖励设计的高效模块重用

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

智能体系统Agent 架构与控制循环

摘要

奖励函数设计仍然是强化学习的瓶颈。虽然 大语言模型 (LLM) 已经实现了自动奖励生成,但现有方法作为整体程序生成和修改奖励函数,使得难以可靠地保留和重用早期迭代中发现的有效组件,从而导致迭代中的性能不稳定。为了解决这个问题,我们提出了模块级奖励进化框架(MLREF)。 MLREF 的核心是模块池,即可重用奖励组件的持久存储库。 MLREF 将模块池视为主要优化对象:模块池通过积累成功的模块、改进表现不佳的模块以及重用经过验证的组件而在迭代中不断发展;而奖励函数被构造为从该池中提取的模块的线性组合。为了推动这一演变,MLREF 集成了三种机制:基于反思的细化、混合信用分配和回滚合并策略,这些机制共同提高了奖励优化的有效性和鲁棒性。 17 项任务的实验表明,MLREF 在运动方面比强基线高出 25.2%,在操作方面比强基线高出 6.6%,并且具有更稳定的优化动态。