论文
LLM 反馈中的策略不变奖励塑造:混合 RL 代理的框架
Policy-Invariant Reward Shaping from LLM Feedback: A Framework for Hybrid RL Agents
摘要
人们越来越多地探索将 大语言模型 与强化学习相结合,但 LLM 派生的奖励信号的理论地位往往是隐含的。我们将混合 LLM 规划器和 RL 控制器架构形式化为目标增强马尔可夫决策过程,并表明当 LLM 每个状态进度分数用作有界势函数时,即使 LLM 分数不准确,所得的整形项也能保留最优策略集。这种保证比一般的 LLM 作为奖励方法提供的保证更强。我们在四种潜在配置下对小型 MDP 进行了数值验证,其中包括缩放至基本奖励幅度 20 倍的对抗性配置。