论文

基于仿真轨迹的LLM引导启发式设计:动态生产与AGV调度案例研究

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

智能体系统Agent 架构与控制循环

摘要

基于仿真的优化(SBO)在随机动态下评估可执行策略,但大多数方法将仿真器视为黑箱:聚合分数仅用于对候选方案排序,而不揭示它们为何失败或应改变哪部分策略逻辑。我们提出一个大语言模型引导的启发式设计框架,利用重复仿真进行选择,并利用事件级轨迹进行诊断。每个当前最优解通过多次重复实验评估,重放其中得分最低的一次会产生可查询的轨迹。一个管理智能体根据该证据提出瓶颈假设,多个编辑智能体并行实施代码级修改。经过执行检查和重复评估后,历史最优选择只保留改进。大语言模型修改发生在评估批次之间,而每次仿真运行由固定策略控制。我们在动态生产与自动导引车(AGV)调度的离散事件仿真中评估该框架。在使用Gemini-3.1-Pro的五次独立优化运行中,最终平均分在仿真器0-100量表上平均为77.51。在得分最高的一次运行中,基于轨迹的诊断催生了主动充电、距离感知的AGV分配和重新平衡的调度优先级,将历史最优平均分从62.49提高到78.61。在100个匹配种子上,最佳最终策略在每个种子上都优于代表性的滚动MILP、基于规则和元启发式的策略,并且在随机故障下无需重新优化仍保持优势。在针对更长时域和可变订单到达间隔分别重新优化后,所得策略再次超过所有基线。使用两个大语言模型骨干的消融实验表明,移除并行候选生成或轨迹数据库访问都会降低最终平均分。这些结果表明,仿真轨迹可以指导复杂基于仿真的调度中针对性的代码级策略改进。

基于仿真轨迹的LLM引导启发式设计:动态生产与AGV调度案例研究:论文配图
图1:基于仿真轨迹的LLM引导启发式设计概览。现任策略及其保留的反馈指导并行的代码级修订。每个有效候选通过RR评分重复实验进行评估,为选择提供平均分。重放所观测到的最低评分重复实验中的随机输入即产生诊断轨迹;其重放得分不计入用于选择的平均分。最佳的改进候选及其保留的反馈成为下一任现任策略。