论文
从搜索到信号:自动启发式设计的在线后期训练
From Search to Signal: Online Post-Training in Automatic Heuristic Design
摘要
基于大语言模型 (LLM) 的自动启发式设计 (AHD) 迭代地提出和完善启发式方法,将设计原理与可执行代码配对。针对特定任务的评估员评估计划;执行结果和绩效分数指导搜索。许多 AHD 系统都会使发电机处于冻结状态;相反,EvoTune 和算法与语言模型共同进化 (CALM) 从评估的候选者中更新它。当此类结果通过可验证奖励(RLVR)驱动强化学习时,它们会创建一个搜索耦合循环:评估的候选流为生成未来候选的模型提供搜索状态更新和训练信号。然而,有效性和性能并不能唯一地决定有用的模型更新。将它们转换为学习信号必须考虑产生每个候选者的提示和不断变化的搜索状态。我们将 AHD 中小型开放权重 LLM 的在线后训练制定为上下文相关的信号构建,并开发从程序有效性、任务性能和生成上下文到更新信号的替代映射。使用共享评估的部署和匹配的更新预算,跨 AHD 任务和模型系列的对照实验将这些映射与在线训练后基线进行比较,测试它们对有效性、有效提案的性能以及在上下文比较下改进的有效提案的产量的影响。补充检查点、冻结搜索和实时系统评估评估提案级增益是否出现在更新的检查点行为和后续搜索中,而不是仅仅来自累积的搜索状态。在预先指定的成本核算下进行资源匹配比较,测试在线更新是否比使用冻结发电机进行额外搜索增加了价值。总之,这种设计避免了将端到端搜索收益单独视为更强的启发式设计能力的证据。