论文

SETA:终端智能体的可扩展环境

SETA: Scaling Environments for Terminal Agents

模型训练强化学习合成数据RLVRAgentic RL

摘要

大语言模型(LLM)正快速转向经多样界面解题的智能体,包括网页与图形用户界面(GUI)。其中,终端命令行提供基于文本的通用界面:覆盖从系统操作到数据科学与机器学习的任务。但终端智能体训练的扩展仍具挑战:它需要多样且连贯的任务指令、可执行环境与可靠验证,同时缺乏自然落地的监督数据。本工作提出SETA:一个生成可验证终端环境以供强化学习(RL)的可扩展框架。框架由共享统一验证机制的两条管线构成:SETA-Synth把多样来源转为标准化RL环境;SETA-Evol从既有环境进一步扩展,自适应控制难度与多样性。两者共同构建并发布SETA-Env——迄今最大的开源可验证终端RL数据集,含超过4,500个环境。我们以SETA-Env训练Qwen3-8B(GRPO)评估数据集:在Terminal-Bench 2.0上取得12%通过率——8B规模RL训练模型的已报告最佳结果;同终端智能体治控下DeepSeek-V4-Flash亦见增益:Terminal-Bench 2.0 pass@1从40%升至43%、pass@5从54%升至58%。结果表明SETA-Env为终端智能体提供高质量训练环境,是推进基于终端的智能体学习研究的宝贵资源。

SETA:终端智能体的可扩展环境:论文配图
图 1:SETA-Synth 管道概述,它将不同的源数据转换为可验证的终端环境以进行代理交互。