论文
TR-ICRL:情境强化学习的测试时反思
TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learning
摘要
上下文强化学习 (ICRL) 使 大语言模型 (LLM) 能够直接在上下文窗口内从外部奖励中在线学习。然而,ICRL 的一个核心挑战是奖励估计,因为模型在推理过程中通常无法获取基本事实。为了解决这个限制,我们提出了上下文强化学习的测试时重新思考(TR-ICRL),这是一种专为推理和知识密集型任务而设计的新颖的 ICRL 框架。 TR-ICRL 的运行方式是首先从给定查询的未标记评估集中检索最相关的实例。在每次 ICRL 迭代期间,LLM 为每个检索到的实例生成一组候选答案。接下来,通过多数投票从该集合中派生出伪标签。然后,该标签充当提供奖励消息并生成形成性反馈的代理,通过迭代细化指导 LLM。最后,这种综合的上下文信息与原始查询相结合,形成综合提示,并通过最后一轮多数投票确定答案。 TR-ICRL 在主流推理和知识密集型任务上进行评估,显示出显着的性能提升。值得注意的是,TR-ICRL 在 MedQA 上平均将 Qwen2.5-7B 提高了 21.23%,在 AIME2024 上甚至提高了 137.59%。广泛的消融研究和分析进一步验证了我们方法的有效性和稳健性。我们的代码可在 https://github.com/pangpang-xuan/TR_ICRL 获取。