论文

语言式试错在经验时代落伍

Language-based Trial and Error Falls Behind in the Era of Experience

模型训练强化学习Agentic RL

摘要

虽然大语言模型(LLM)在基于语言的agentic任务中表现出色,但它们对未见过的非语言环境(如符号或空间任务)的适用性仍然有限。先前工作将这一性能差距归因于预训练分布与测试分布的不匹配。在本工作中,我们证明主要瓶颈是探索的高昂代价:掌握这些任务需要大量试错,而对在高维语义空间中运行的参数量庞大的LLM来说,这在计算上不可持续。为此,我们提出SCOUT(Sub-Scale Collaboration On Unseen Tasks),一个将探索与利用解耦的新框架。我们采用轻量级侦察员(如小型MLP)以远超LLM的速度和规模探测环境动态。收集到的轨迹用于通过监督微调(SFT)引导LLM,随后进行多轮强化学习(RL)以激活其潜在世界知识。经验上,SCOUT使Qwen2.5-3B-Instruct模型达到平均0.86的得分,显著优于包括Gemini-2.5-Pro(0.60)在内的专有模型,同时节省约60%的GPU小时消耗。

语言式试错在经验时代落伍
图2:SCOUT 框架概览。该流水线包含三个阶段:(1) Exploration Stage:轻量级 scouts 高效捕捉环境动态以生成专家轨迹;(2) Distillation Stage:这些轨迹被文本化,通过监督微调“预热”(warm-up)LLM;(3) Evolving Stage:LLM 通过多轮 PPO 进一步提升其推理与决策能力。