论文
AdaEva:以自适应部分评估加速 LLM 驱动的算法设计
AdaEva: Accelerating LLM-Driven Algorithm Design with Adaptive Partial Evaluation
摘要
大语言模型 (LLM) 越来越多地用于自动化算法设计。然而,评估生成的算法的计算成本可能过高。我们考虑常见的 LLM 驱动的自动化算法设计 (LLM4AD) 设置,其中通过聚合一组共享的训练实例的性能来评估候选算法。这种实例结构提出了一个自然的问题:在决定每个候选者是否保持竞争力之前,是否必须在整个实例集上对每个候选者进行评估?受算法配置的启发,我们引入了 AdaEva,这是一种嵌入式自适应部分评估框架,可逐步评估同一实例池的较大子集上的候选者,并随着证据的积累消除没有希望的候选者。重要的是,AdaEva 保持底层 LLM4AD 过程和每个实例评估器不变,并且不需要有关实例难度的先验知识。我们使用连续减半 (AdaEva-S) 和统计竞赛 (AdaEva-R) 来实例化这个想法,并评估三个代表性 LLM4AD 框架、多个 LLM 骨干模型 以及跨越组合和连续黑盒优化的优化领域的两种机制。在匹配的评估预算下,AdaEva 比固定的部分评估策略更可靠地平衡候选者之间的评估工作,从而产生强大的搜索效率和随时性能,以及在评估设置中改进的 留出 泛化能力。