论文

基于学习型优化策略的教师感知启发式程序演化

Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies

模型推理推理搜索与路径规划

摘要

基于LLM的自动启发式设计在为组合优化生成可执行启发式方面展现出前景,但现有方法主要依赖滞后的端点性能。我们提出一个教师感知的演化框架,将独立训练的学习型优化策略用作行为教师。我们的方法不部署也不模仿教师,而是在候选启发式程序所访问的状态上查询教师,并将其动作偏好用作演化的局部反馈。由此得到的搜索在任务性能与教师派生行为信号的双重引导下发现静态可执行启发式。在调度、路由与图优化基准上的实验表明,我们的方法优于性能驱动的LLM启发式演化基线,且部署时无需神经推理。这些结果表明,学习型优化策略可以被重新用作自动启发式发现的行为反馈来源。

基于学习型优化策略的教师感知启发式程序演化:论文配图
图 1:所提出的教师意识进化启发式设计框架概述。候选启发式程序通过推出进行评估,针对黑盒学习教师在自己访问过的状态进行查询,通过分析器引导的教师感知模式进行修改,并通过目标行为帕累托群体管理进行保留。