论文
基于学习型优化策略的教师感知启发式程序演化
Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies
摘要
基于LLM的自动启发式设计在为组合优化生成可执行启发式方面展现出前景,但现有方法主要依赖滞后的端点性能。我们提出一个教师感知的演化框架,将独立训练的学习型优化策略用作行为教师。我们的方法不部署也不模仿教师,而是在候选启发式程序所访问的状态上查询教师,并将其动作偏好用作演化的局部反馈。由此得到的搜索在任务性能与教师派生行为信号的双重引导下发现静态可执行启发式。在调度、路由与图优化基准上的实验表明,我们的方法优于性能驱动的LLM启发式演化基线,且部署时无需神经推理。这些结果表明,学习型优化策略可以被重新用作自动启发式发现的行为反馈来源。
