论文
T1:针对长期任务的终端代理强化学习
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
摘要
代理的使用正在转向编码和科学发现等长期任务,其中终端任务尤其重要。我们引入了 T1,这是一个经过强化学习训练的总共 122B 专家混合模型,在云沙箱中操作真实的 shell,每个任务最多可进行 300 多次工具调用,并通过执行每个任务自己的验证器来获得奖励。我们提供了一个全面的方案:首先,积极热启动以稳定演员批评家训练,并通过密集的过程根据通过验证者的绝对数量奖励评分轨迹。其次,通过 TITO 构建进行稳定优化,对精确采样的词元标识符进行训练,并在回合边界处进行漂移修复,并采样路由重放,在每个 MoE 层记录采样器的每个词元专家选择并在训练期间重放它们。第三,完全分布外的训练语料库:与 Terminal-Bench 2.1 分离的孤立种子和合成任务确保收益反映了真正的能力转移而不是基准过度拟合。 TITO 和 R3 共同将训练到推理的对数概率差异从 0.021 减少到 0.013,并在损失区域中精确对齐零词元漂移。在 Terminal-Bench 2.1 上,我们的训练后管道将初始基础模型从 43.8% 提高到 T1,解决了 64.0%。在 Long-Horizon Terminal Bench 上,T1 达到 27.9%,超过了 GPT-5.4 和 GLM-5.1。