论文

Tmax:终端代理的简单配方

Tmax: A simple recipe for terminal agents

模型训练强化学习

摘要

使用终端的代理已迅速成为语言模型(LM)最流行的下游应用。尽管它们很流行,但相对较少的学术工作研究了这些模型的基于强化学习的训练,这可能是由于基准比较困难、缺乏数据以及缺乏简单的基线方法。我们推出了 Tmax,这是迄今为止针对终端代理的最强大的开放 RL 配方,使开放数据配方更接近前沿。虽然很简单,但我们的方法在 Terminal-Bench 2.0 上仅用 9B 个参数就实现了 27%,优于之前工作中更大的模型。具体来说,我们使用一种新颖的分类法生成数据,结合难度控制、角色和验证者多样化,这使我们能够廉价地生成大量用于 RL 和 SFT 训练的终端环境。我们开源了我们的终端数据集,该数据集比之前发布的终端代理数据集大 2.5 倍以上。然后,我们使用 RL 和我们的数据来训练开放权重模型,使用一个简单的、仅结果的方法。我们在 https://github.com/hamishivi/tmax 上发布了我们的数据、模型和代码,作为未来终端代理开放学术工作的强大基线。