论文
人工智能科学家通过综合任务扩展
AI Scientist via Synthetic Task Scaling
摘要
随着人工智能代理的出现,自动科学发现已成为一个可行的目标。最近的许多工作都构建了可以执行机器学习研究的代理系统,但没有提供训练此类代理的原则性方法——而当前的大语言模型经常会产生看似合理但无效的想法。为了在可以从实践中学习的训练代理方面取得进展,我们提供了一种针对机器学习代理的新型合成环境生成管道。我们的管道自动综合与 SWE-agent 框架兼容的机器学习挑战,涵盖主题采样、数据集提议和代码生成。由此产生的综合任务 1) 基于真实的机器学习数据集,因为所提出的数据集是针对 Huggingface API 进行验证的,并且 2) 通过自调试循环验证了更高的质量。为了验证我们的综合任务的有效性,我们使用了 MLGym,这是机器学习任务的基准。从综合任务中,我们从教师模型 (GPT-5) 中采样轨迹,然后使用这些轨迹来训练学生模型(Qwen3-4B 和 Qwen3-8B)。使用我们的综合任务训练的学生模型在 MLGym 上的性能得到了提高,Qwen3-4B 的 AUP 指标提高了 9%,Qwen3-8B 的 AUP 指标提高了 12%。
