论文

LLM会从具体情况中的奖励中学习吗? :重新思考奖励在情境强化学习中的作用

Do LLMs Learn from Rewards in Context? : Rethinking the role of reward in In-Context Reinforcement Learning

模型评测模型推理上下文与知识推理策略与问题分解记忆模型行为与机制分析

摘要

LLM 智能体通过在上下文中积累经验而不是通过更新参数来不断提高推理时间。这个过程通常被描述为上下文强化学习(ICRL)。然而,情境学习(ICL)是否真的可以发挥强化学习的作用,尚未得到测试。我们以最简单的形式(直接 ICRL)研究这个问题,其中模型直接以原始轨迹-奖励对为条件,并询问奖励是否充当学习信号。通过对六个模型的四个基准的受控实验,我们发现奖励被读取,但其影响很小:翻转、随机化或删除奖励使改进曲线几乎保持不变,即使在明确指示模型探索、利用或推理奖励的元提示下,这一点也成立。轨迹推动改进,但不是通过其语义内容:打乱或损坏的轨迹与真实轨迹一样有效。这些模式与 ICL 中已知的模式非常相似,这表明直接 ICRL 更好地理解为 ICL 的特例,而不是推理时间 RL。这种重构对智能体记忆设计有影响:输入分布和演示等 ICL 因素可能比奖励塑造和探索等 RL 元素更重要。