论文

通过跨片段元强化学习扩展LLM的上下文在线学习能力

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

模型训练强化学习Agentic RL

摘要

当所有任务相关信息在开始时即可获得时,例如静态预测与指令遵循问题,大语言模型(LLM)能取得强劲表现。然而,许多现实世界的决策任务本质上是在线的:关键信息必须通过交互获取,反馈是延迟的,有效行为需要在时间推移中平衡信息收集与利用。虽然上下文学习(in-context learning)使模型无需更新权重即可适应,但现有LLM在这类设定下往往难以可靠地利用上下文中的交互经验。在这项工作中,我们表明这一局限可以通过训练解决。我们提出ORBIT,一个多任务、多片段的元强化学习框架,训练LLM在上下文中从交互中学习。元训练之后,一个相对较小的开源模型(Qwen3-14B)在完全未见过的环境上展现出显著提升的上下文在线学习能力,达到GPT-5.2的表现,并大幅超越标准RL微调。缩放实验进一步显示增益随模型规模一致增长,这表明在推理时学习的决策智能体仍有可观空间。复现论文结果的代码见 https://github.com/XiaofengLin7/ORBIT。

通过跨片段元强化学习扩展LLM的上下文在线学习能力
图2:面向企业工具使用的多回合(Multi-Episode)Meta-RL 示例。(上)标准 RL 通常将各个回合视为状态重置的孤立事件(tabula rasa),阻碍了已学到的环境约束(如 API 模式、速率限制)在多次尝试之间的迁移。(下)Meta-RL 框架支持跨回合的上下文内适应。智能体积累持久的交互历史,使其能够从探测未知工具(Ep 1),到基于错误精化策略(Ep 2),再到最终利用已习得的心智模型(Ep 3)进行可靠执行,全程无需权重更新。