论文

LLM 什么时候对于顺序 RL 任务来说是足够的策略优化器?

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

模型推理推理搜索与路径规划

摘要

我们研究 大语言模型 (LLM) 何时可以作为强化学习 (RL) 任务的有效黑盒策略优化器,即我们何时可以用 LLM 取代经典 RL 算法?我们通过引入提示策略优化(PromptPO)来探索这个问题,这是一种迭代方法,用状态空间、动作空间和奖励函数的 Python 描述来提示 LLM,然后让它根据轨迹采样反馈生成和完善可执行策略。在艰苦的探索环境、元世界机器人任务和几个现实世界的控制问题中,PromptPO 通常可以匹配或超过标准 RL 基线的性能,同时使用更少的环境交互。为了最大化预期回报,并且无需进一步明确提示,策略 PromptPO 输出范围从调整比例控制器或基于规则的计划到运行值迭代等规划算法的策略。我们的结果表明,当 LLM 可以利用有关环境或优化策略的先验知识时,基于 LLM 的策略优化就足够了。 PromptPO 在 MuJoCo 域中的表现低于标准 RL 基线。这表明基于 LLM 的策略优化对于需要细粒度连续控制的设置可能存在限制。