论文
用于训练机器学习工程代理的合成沙箱
Synthetic Sandbox for Training Machine Learning Engineering Agents
摘要
随着 大语言模型 代理从软件工程 (SWE) 任务向机器学习工程 (MLE) 迈进,验证代理行为的成本将提高几个数量级:虽然 SWE 任务可以通过快速执行的单元测试进行验证,但 MLE 验证需要在每个轨迹采样步骤的大型数据集上运行完整的 ML 管道(数据预处理、模型训练 和指标评估),使按轨迹进行的 同策略 强化学习 (RL)慢得令人望而却步。现有方法退回到有监督的 微调 (SFT) 或离线代理奖励,从而牺牲了 同策略 RL 的探索和泛化优势。我们观察到沙箱数据大小是此瓶颈的主要来源。基于这一见解,我们引入了 SandMLE,这是一个多智能体框架,它可以从少量种子任务生成多样化、可验证的合成 MLE 环境,保留现实世界问题的结构和技术复杂性,同时将数据集限制在微观规模(每个任务仅与 50-200 个训练样本配对)。通过大量实验,我们表明 SandMLE 将执行时间减少了 13 倍以上,首次在 MLE 领域实现了大规模 同策略 轨迹强化学习。在 MLE-bench-lite 上,SandMLE 在 Qwen3-8B、14B 和 30B-A3B 上比 SFT 基线有了显着的提升,相对奖牌率提高了 20.3% 到 66.9%。此外,训练有素的策略可以推广到看不见的代理支架,在 MLE-Dojo 上实现高达 32.4% 的 HumanRank 分数。