论文
学习终端代理的可推广行为
Learning Generalizable Behaviors for Terminal Agents
摘要
终端代理是 大语言模型 (LLM) 的一个引人注目的应用程序,具有深入集成到用户日常工作流程中的潜力。强化学习 (RL) 是提高能力的关键技术,使可扩展的训练环境成为核心挑战。由于公共真实用户交互数据稀缺,合成环境提供了一种实用的替代方案,但经常受到领域差距和保真度有限的影响,导致泛化能力较差。现有的工作主要扩展合成环境的数量和多样性,而奖励信号质量和泛化机制仍有待探索。我们研究强化学习如何改进终端智能体,并提出智能体组合泛化假设:强化学习不是从头开始教授新的特定领域技能,而是主要塑造高层决策行为,这些行为组合和路由在 预训练 和监督 微调 (SFT) 期间获得的底层技能。这个解释与我们的实证结果一致,并表明验证者的质量决定了哪些行为得到强化,比简单地增加环境数量或多样性更重要。受这一见解的启发,我们提出了 River,这是一种简单的训练方法,通过过滤低质量环境并通过过程级行为正则化增加结果奖励来提高奖励质量。使用此配方,我们的 RL 训练代理在四个终端代理基准评估的开源 RL 训练 8B 模型中实现了最佳性能。 River 还概括了模型系列、规模、智能体利用和强化学习目标。 River 使用不到 30% 的 TMax 训练环境,在 Terminal-Bench-Lite 和 Terminal-Bench-v2.1 上将 2B 到 27B 模型的 RL 增益平均分别提高了 106% 和 30%。