论文

RF-Agent:通过语言智能体树搜索自动设计奖励函数

RF-Agent: Automated Reward Function Design via Language Agent Tree Search

智能体系统Agent 规划

摘要

为低层控制任务设计高效的奖励函数是一个具有挑战性的问题。近期研究旨在通过使用携带任务信息的大语言模型(LLM)生成稠密奖励函数,以减少对专家经验的依赖。这些方法通常以训练结果作为反馈,用贪婪或进化算法迭代生成新的奖励函数。然而,它们对历史反馈的利用不佳、搜索效率低下,导致在复杂控制任务上改进有限。为应对这一挑战,我们提出RF-Agent,一个把LLM当作语言智能体、将奖励函数设计视为序贯决策过程的框架,通过更好的上下文推理增强优化。RF-Agent集成蒙特卡洛树搜索(MCTS)来管理奖励设计与优化过程,发挥LLM的多阶段上下文推理能力。这一方法更好地利用历史信息并提升搜索效率,从而找到有前景的奖励函数。在17项多样化低层控制任务上出色的实验结果证明了我们方法的有效性。源代码见 https://github.com/deng-ai-lab/RF-Agent。

RF-Agent:通过语言智能体树搜索自动设计奖励函数
图1:快速概览。(a) 从序贯决策视角重塑基于 LLM 的奖励函数设计问题。(b) 不同方法的抽象流水线比较。(c) 不同方法在最大成功率与完整训练次数方面的比较。