论文
长任务Agent后训练的跨基准迁移
Cross-Benchmark Generalization in Long-Horizon Agents
摘要
对于独立环境中的强化学习(RL),策略可以通过利用环境特定的规律(工具模式、评分器解析、任务模板)而不是通过获取可转移的技能来获得奖励,并且分布中的坚持者共享这些规律。我们认为,区分问题是行为问题,即训练有素的代理如何行动,而跨基准转移是寻找它的正确位置。我们使用两阶段 SFT-then-RL 管道,在 27 个类别的 363 个长视野模型上下文协议 (MCP) 任务上对开放权重专家混合模型 (Qwen3.5-122B-A10B) 进行后训练。工具马拉松表现告知了最初的基础系列和 SFT 教师选择,但没有外部基准任务或评分者进入训练,也没有外部分数告知奖励、训练超参数、训练检查点选择或停止。在贪婪 pass@1 中,训练后的模型在五个报告的外部评估的基础上有所改进:Toolathlon (+9.6 pp)、$τ^2$-Bench (+5.3 pp)、BFCL-V4 (+3.5 pp)、SWE-Bench Pro (+5.8 pp) 和 Terminal-Bench 2 (+2.8 pp)。尽管训练集合不包含软件工程任务,但这两个软件工程基准都有所提高。探索性配对轨迹分析确定了四种反复出现的行为差异(更仔细的本地目标形成、建立与目标相关的工作状态、通过本地修复保持父目标稳定以及验证完成情况),这些差异在办公室工作流程和代码中以类似的形式出现。这些结果提供了描述性证据,表明长期多工具 后训练 可以改变工作方式,超越其训练领域。