论文
AHD Agent:自动启发式设计的智能体强化学习
AHD Agent: Agentic Reinforcement Learning for Automatic Heuristic Design
摘要
自动启发式设计 (AHD) 已成为解决 NP 难组合优化问题 (COP) 的有前途的范例。最近的研究表明,大语言模型(LLM)在集成到精心设计的框架(即 LLM-AHD)中时,可以自主发现高性能启发式方法。然而,现有的 LLM-AHD 框架通常将 LLM 视为固定工作流程中的被动生成器,其中模型从手动设计的有限上下文中生成启发式方法。这样的上下文可能无法捕获与状态相关的信息(例如,特定的故障模式),从而导致低效的试错探索。为了克服这些限制,我们提出了 AHD Agent,这是一种新颖的工具集成、多轮框架,使LLM能够主动决定是生成启发式方法还是调用工具从求解环境中检索目标证据。为了有效地训练这种动态决策代理,我们引入了代理强化学习(RL)系统,该系统利用新颖的环境合成管道来优化紧凑模型的通用 AHD 功能。跨八个不同领域(包括四个保留任务)的实验表明,我们的 4B 参数代理使用更大的模型匹配或超越了最先进的基线,同时需要的评估明显减少。模型和推理扩展分析进一步表明,AHD Agent 提供了实现真正自主启发式设计的有效轨迹。
