论文

面向大语言模型工具使用的上下文强化学习

In-Context Reinforcement Learning for Tool Use in Large Language Models

模型训练强化学习Agentic RL

摘要

尽管大语言模型(LLM)展现出强大推理能力,其在复杂任务上的表现常受内部知识局限的制约。克服这一挑战的一个有力途径是为模型配备外部工具——例如用于数学计算的Python解释器或用于检索事实信息的搜索引擎。然而,让模型有效使用这些工具仍是一大挑战。现有方法通常依赖先监督微调(SFT)后强化学习(RL)的冷启动流水线。这些方法往往需要大量SFT标注数据,而其标注或合成成本高昂。本工作提出上下文强化学习(ICRL),一个纯RL框架,通过在RL的rollout阶段利用少样本提示而免去SFT。具体而言,ICRL在rollout提示中引入上下文示例,教模型如何调用外部工具。此外,随着训练推进,上下文示例数量逐渐减少,最终达到零样本设定,模型学会独立调用工具。我们在一系列推理与工具使用基准上开展了大量实验。结果表明ICRL取得最先进性能,证明其作为传统基于SFT流水线的可扩展、数据高效替代方案的有效性。

面向大语言模型工具使用的上下文强化学习:论文配图
图 1:ICRL 训练工作流程。该模型通过多阶段课程进行训练,逐渐减少推出模板中上下文示例的数量。在每个阶段,LLM都会生成工具增强的部署,获得奖励,并通过强化学习更新其策略,从而实现从模仿到自主工具使用的转变。