论文
OpenThoughts-Agent:智能体模型的数据配方
OpenThoughts-Agent: Data Recipes for Agentic Models
摘要
智能体语言模型极大扩展AI的应用——但公众对如何为大能力智能体策展训练数据知之甚少。既有开放努力如SWE-Smith、SERA与Nemotron-Terminal通常只针对单一基准——留下如何训练跨多样智能体任务泛化的模型这一开放问题。OpenThoughts-Agent(OT-Agent)项目以完全开放的数据策展管线填补该缺口。我们开展100多项受控消融实验——系统调查管线的每一阶段——得出关于任务来源与多样性重要性的洞见。然后我们从该管线组装10万示例的训练集——并在此数据集上微调Qwen3-32B——在七个智能体基准上取得44.8%平均准确率——较最强既有开放数据智能体模型(Nemotron-Terminal-32B,40.9%)提升3.9个百分点。此外——我们的训练数据展现强扩展性质——在算力受控比较中的每个训练集规模上都优于替代开放数据集。我们在openthoughts.ai公开训练集、数据管线、实验数据与模型——以支持智能体模型训练的未来开放研究。
