论文

面向基于LLM启发式发现的博弈论共同演化

Game-Theoretic Co-Evolution for LLM-Based Heuristic Discovery

模型推理推理搜索与路径规划

摘要

大语言模型(LLM)推动了自动启发式发现(AHD)的快速进展,但多数现有方法主要受限于针对固定实例分布的静态评估,导致潜在过拟合以及在分布偏移下的泛化不佳。我们提出算法空间响应预言机(ASRO),一个博弈论框架,把启发式发现重构为求解器与实例生成器之间的程序级共同演化。ASRO将其交互建模为两人零和博弈,在双方维护不断增长的策略池,并通过基于LLM的最优响应预言机对抗混合对手元策略迭代扩展它们,从而用自适应、自生成的课程取代静态评估。跨多个组合优化领域,ASRO持续超越基于相同程序搜索机制构建的静态训练AHD基线,在多样与分布外实例上取得显著更优的泛化与鲁棒性。

面向基于LLM启发式发现的博弈论共同演化
图3:ASRO 在组合优化任务上的训练动态。(上) ASRO 在 OBP、TSP 和 CVRP 上的收敛行为,以 solver exploitability、generator exploitability 和 ANC 随迭代次数的变化衡量,展示一个代表性的 ASRO 运行;阴影区域表示通过对实例进行 bootstrap 重采样得到的置信区间(每个生成器 20 个实例)。(下) 跨随机运行的稳定性:对每个任务最难的基准进行五次独立运行的测试间隙(test gap)(%)(均值 ± 标准差),基准难度由 EoH 基线排名确定。