论文

使用 编码智能体 实现算法发现的有效利用工程

Effective Harness Engineering for Algorithm Discovery with Coding Agents

智能体系统Agent Harness

摘要

AlphaEvolve 和 FunSearch 展示了将 大语言模型 (LLM) 与进化搜索相结合以实现自动算法发现的潜力。然而,发现的成功不仅取决于模型能力,而且还很大程度上取决于执行基础设施(即工具)的设计。本文通过三个问题来研究有效的Harness设计:在固定的 词元预算 下,是用简短的思想产生更多的算法更好,还是用更深入的思想产生更少的算法更好?当生成的程序利用评分功能时,该工具应如何处理评估黑客行为?需要完全文件系统访问的代理如何安全地并行执行?使用 Vesper(一种算法发现框架,该框架结合了解决这些问题的Harness改进),我们在相同的 词元预算 下对 Circle Packing 进行评估。有趣的是,生成更少的算法,同时更深入地思考每个算法,可以获得更高的分数。也就是说,扩大每个个体的质量比扩大进化世代的数量更具预算效率。令人惊讶的是,功能更强大的模型以更高的速度产生评估黑客攻击,这使得随着模型规模的扩大,黑客检测变得越来越必要。