论文

人工智能科学家通过综合任务扩展

AI Scientist via Synthetic Task Scaling

模型训练合成数据

摘要

随着人工智能代理的出现,自动科学发现已成为一个可行的目标。最近的许多工作都构建了可以执行机器学习研究的代理系统,但没有提供训练此类代理的原则性方法——而当前的大语言模型经常会产生看似合理但无效的想法。为了在可以从实践中学习的训练代理方面取得进展,我们提供了一种针对机器学习代理的新型合成环境生成管道。我们的管道自动综合与 SWE-agent 框架兼容的机器学习挑战,涵盖主题采样、数据集提议和代码生成。由此产生的综合任务 1) 基于真实的机器学习数据集,因为所提出的数据集是针对 Huggingface API 进行验证的,并且 2) 通过自调试循环验证了更高的质量。为了验证我们的综合任务的有效性,我们使用了 MLGym,这是机器学习任务的基准。从综合任务中,我们从教师模型 (GPT-5) 中采样轨迹,然后使用这些轨迹来训练学生模型(Qwen3-4B 和 Qwen3-8B)。使用我们的综合任务训练的学生模型在 MLGym 上的性能得到了提高,Qwen3-4B 的 AUP 指标提高了 9%,Qwen3-8B 的 AUP 指标提高了 12%。

ML-AutoResearch:用自动生成环境训练机器学习研究智能体:论文配图
图 1:我们的任务和轨迹生成工作流程的图示。至关重要的是,任务生成过程不需要人工监督。相反,它会自动对机器学习主题进行采样,并建议在任务中使用的数据集。为了解决生成任务中的编译问题,我们通过调试循环进一步增强生成,而不是立即完全丢弃任务。