论文

进化还是幻觉?重新思考大语言模型进化搜索中的评估

Evolution or Illusion? Rethinking Evaluation in LLM Evolutionary Search

模型评测评测方法与指标

摘要

LLM 驱动的进化搜索通过启动种子并迭代每个程序来查找程序。论文报告了单一预算设置,通常是一次种子运行固定次数的迭代,以及从这一点开始的排名方法。我们证明这还不够。我们评估了五种优化任务的三种进化搜索策略,该类型的论文通常使用这些策略来报告结果。我们对完整的种子网格和迭代进行分析。我们的研究结果表明,在更多种子(宽度)和更多迭代(深度)之间分配固定预算的最佳方式会随着策略、任务和总预算的变化而变化。此外,我们观察到策略的排名也会随着预算的变化而变化。在一项任务中,在一颗种子上看起来最差的策略在四十颗种子上看起来最好。另一方面,最佳迭代次数远低于实践中常见的值,因此额外的深度会浪费预算,更多的种子会转化为分数。我们提供了一个测量协议,报告种子迭代前沿和使用它的实用指南。