论文

整合Agentic机器学习工程系统的见解

Assembling Insights for Agentic Machine Learning Engineering Systems

上下文与知识记忆Agent记忆

摘要

Agentic机器学习工程 (MLE) 是一种新兴的 AI4SE 应用程序,用于复杂的 ML 任务,也是 AI 系统递归自我改进的一步。最近的Agentic MLE 系统显示了利用相关 MLE 任务的见解的价值:一些系统根据专家领域知识来生成代码,这些知识是从同行 MLE 任务隐式策划的;有些系统有一个解决 MLE 任务的循环,收集记忆以有利于未来的任务。然而,洞察收集和注入仍然是临时的,并且现有的评估通常不控制洞察来源,使得数据泄露对有效性构成威胁。为了弥补这些差距,我们系统地研究了相关 MLE 任务的洞察如何影响Agentic MLE 系统,以及它们的影响如何取决于洞察类型和注入方法。我们推出 MLE-InsightBench,这是跨 12 个领域的 160 场 Kaggle 竞赛的基准。为了防止泄漏,每个域的一个竞争以留出作为目标,而其余 148 个竞争仅在不受目标任务影响时(例如通过更高版本或重复使用的解决方案)充当源。我们还开发了 MLE-InsightForge,这是一个洞察组件智能体,它探索源竞争、顶级人类解决方案和文章,以构建三种洞察类型:总结最佳实践的 12 个领域洞察、描述获胜解决方案的 148 个竞争洞察以及捕获通用调试和优化策略的 16 个改进洞察。这些见解可以作为按需技能或作为前期剧本注入。在我们的评估中,提取的见解将标准化私人测试分数比无见解基线提高了 123.9%。对照实验进一步表明,这三种洞察类型是互补的。更好的注入模式(技能与剧本)因任务而异,总体而言技能更具成本效益;并且收益普遍存在于后端LLM中。