论文

MARS:面向自动化 AI 研究的模块化反思式搜索 Agent

MARS: Modular Agent with Reflective Search for Automated AI Research

智能体系统上下文与知识记忆Agent 规划Agent记忆

摘要

由于计算成本高昂的评估(例如模型训练)和不透明的性能归因,自动化人工智能研究与一般软件工程不同。当前基于 LLM 的代理在这方面举步维艰,通常会生成忽略执行成本和因果因素的整体脚本。我们推出 MARS(带有反思式搜索的模块化代理),这是一个针对自主人工智能研究优化的框架。 MARS 依赖于三个支柱:(1) 通过成本受限的蒙特卡罗树搜索 (MCTS) 进行预算感知规划,以明确平衡性能与执行费用; (2)模块化构建,采用“设计-分解-实施”流程来管理复杂的研究存储库; (3) 比较反思记忆,通过分析解决方案差异来提取高信号洞察来解决贡献归因问题。 MARS 在 MLE-Bench 上同类设置下的开源框架中实现了最先进的性能,保持了与全球排行榜顶级方法的竞争力。此外,该系统表现出定性的“啊哈!”时刻,所有使用的经验中有 63% 来自跨搜索分支迁移,这表明代理有效地概括了跨搜索路径的见解。

MARS:面向自动化 AI 研究的模块化反思式搜索 Agent
图2:MARS 框架概览。MARS 将长程编码重新表述为对最优软件仓库的搜索。(1)任务准备:智能体通过对给定数据集和元数据的探索性分析,将抽象问题(Instruction、Environment、Objective)元组落地。(2)MARS 循环:智能体通过三个协同模块迭代演化解决方案:(A)资源感知规划:预算感知的 MCTS 通过从 {Draft new architecture, Debug runtime errors, Improve a valid solution} 中选择动作,策略性地在搜索空间中导航。它优化一种效率引导的奖励,在性能最大化与高执行成本的惩罚之间进行显式权衡。(B)模块化分解:为取代脆弱的单体式脚本,系统采用“设计-分解-实现”流程。专门的 {Idea, Modular, Coding} 智能体将解决方案架构为独立、可测试的模块。这种结构支持基于 Diff 的精确精炼,使智能体能够更新特定逻辑块,而无需重新生成整个代码库。(C)反思记忆:该模块将原始执行日志蒸馏为结构化的调试(Debugging)与解决方案(Solution)经验教训(Lessons),以主动防止错误重复并加速后续迭代的收敛。