论文

自进化LLM的计算分配:从深度-广度到多臂强盗

Compute Allocation for Self-Evolving LLMs: From Depth-Breadth to Multi-Armed Bandits

模型推理测试时计算扩展

摘要

LLM 引导的进化搜索(进化系统)已在数学和组合任务上达到了最先进的结果,但大多数现有系统仅报告许多运行中的最佳结果,并且未记录运行间分布。我们询问如何分配 LLM 调用的固定预算,以及单次运行达到报告数量的可靠性如何。通过扫描五个模型和三个任务的深度-广度网格,我们确定了两个经验规律:一个适应度计算包络,当在有效的 FLOP 中测量时,能力排序在很大程度上崩溃,以及与特定任务交互的双线性深度-广度拟合;两者都受到模型任务能力的限制。受这些规律的启发,我们提出了 BaSE(基于 Bandit 的自我进化),这是一种多臂 bandit,可以在并行轨迹上分配 LLM 调用。在不更改模型、提示或评估器的情况下,BaSE 比 8 个(模型、任务)单元中最强的岛屿协议基线提高了 12.3% 的平均适应度,在高方差设置上收益最大:仅通过分配获得的可靠性收益。