论文

OpenThoughts-Agent:智能体模型的数据配方

OpenThoughts-Agent: Data Recipes for Agentic Models

模型训练合成数据

摘要

智能体语言模型极大扩展AI的应用——但公众对如何为大能力智能体策展训练数据知之甚少。既有开放努力如SWE-Smith、SERA与Nemotron-Terminal通常只针对单一基准——留下如何训练跨多样智能体任务泛化的模型这一开放问题。OpenThoughts-Agent(OT-Agent)项目以完全开放的数据策展管线填补该缺口。我们开展100多项受控消融实验——系统调查管线的每一阶段——得出关于任务来源与多样性重要性的洞见。然后我们从该管线组装10万示例的训练集——并在此数据集上微调Qwen3-32B——在七个智能体基准上取得44.8%平均准确率——较最强既有开放数据智能体模型(Nemotron-Terminal-32B,40.9%)提升3.9个百分点。此外——我们的训练数据展现强扩展性质——在算力受控比较中的每个训练集规模上都优于替代开放数据集。我们在openthoughts.ai公开训练集、数据管线、实验数据与模型——以支持智能体模型训练的未来开放研究。

OpenThoughts-Agent:智能体模型的数据配方:论文配图
图 1:OpenThoughts-Agent-SFT 数据集在 Terminal-Bench 2.0 上实现了 SotA 性能,并在大型数据集规模上验证了 SWE-Bench 的 100 个子集。所有基准的平均值超过了表中报告的七个基准。关于 SERA 的附加说明如下。22 2 SERA 使用 SWE-agent 进行数据生成和评估,因此我们报告了 SWE-Bench 和 Terminal-Bench 上的 SWE-agent(实线)和 Terminus-2(虚线)线束,以及每个基准测试中最好的两个线束的平均值。 SERA 的数据集最多包含 47K 个示例,因此其缩放曲线停在 47K 处。