论文
MLToolBench:用于机器学习开发的学习工具增强Agent
MLToolBench: Learning Tool-Augmented Agents for Machine Learning Development
摘要
机器学习工程 (MLE) Agent已经取得了实质性进展,但通过 ML 实验进行学习仍然需要花费大量时间和计算成本。合成环境降低了这些成本,同时引入了需要特定任务诊断的数据和实验设置的变化。仅获得诊断工具并不能确保Agent了解何时使用它们或如何根据其发现采取行动。我们介绍了 ToolMLBench,这是一套用于数据检查、代码验证和实验诊断的可执行工具,以及用于学习其使用的 SFT 和 RL 管道。诊断呼叫获取的证据的价值取决于后续决策,因此最终结果对于强化哪些呼叫提供了有限的指导。我们通过 SPICE 来应对这一挑战,它衡量特权上下文如何改变采样工具操作的可能性,并将这种差异用作最终结果的回合级奖励。我们对 80 项综合任务进行训练,并对 25 项域内任务和 10 项域外任务进行评估。仅提供工具接口和描述会在未适应的模型中产生不一致的收益。使用相同的诊断接口,我们的训练管道将 Qwen3-8B 的域内成功率从 24.8% 提高到 52.4%,将 Qwen3.5-35B-A3B 的域内成功率从 35.6% 提高到 69.2%。后者的域外性能也从 31% 提高到 48%,支持在保留的源和目标上使用学习的诊断工具。