论文

ReVEL:经由结构化性能反馈的多轮反思式LLM引导启发式演化

ReVEL: Multi-Turn Reflective LLM-Guided Heuristic Evolution via Structured Performance Feedback

智能体系统Agent Harness

摘要

为 NP 难组合优化问题设计有效的启发式方法仍然是一项具有挑战性且需要大量专业知识的任务。大语言模型 (LLM) 的现有应用主要依赖于一次性代码合成,产生脆弱的启发式方法,未充分利用模型的迭代推理能力。我们提出了 ReVEL:通过结构化性能反馈进行多轮反射 LLM 引导的启发式进化,这是一种混合框架,将 LLM 作为交互式多轮推理机嵌入到进化算法 (EA) 中。 ReVEL 的核心在于两种机制:(i) 绩效概况分组,将候选人启发式聚类为行为一致的组,为大语言模型提供紧凑且信息丰富的反馈; (ii) 多轮、反馈驱动的反思,大语言模型通过这种反思分析群体层面的行为并产生有针对性的启发式改进。这些改进由基于 EA 的元控制器选择性地集成和验证,该控制器自适应地平衡探索和利用。标准组合优化基准的实验表明,ReVEL 始终能够产生更加稳健和多样化的启发式算法,与强基线相比,实现了统计上显着的改进。我们的结果强调了将结构化分组作为自动启发式设计的原则范例的多轮推理。

ReVEL:经由结构化性能反馈的多轮反思式LLM引导启发式演化
图 1:通过结构化性能反馈 (ReVEL) 进行多轮反射 LLM 引导的启发式进化:该框架从群体初始化开始,创建一组多样化的候选启发式。然后将候选人分组,以确保一致性和多样性。反思性多轮细化迭代地评估、诊断和改进启发式方法。最后,人口管理保留了平衡质量和多样性的候选人,从而实现持续的启发式进化。