论文
DynaSchedBench:经校准的动态调度基准与基于LLM的调度智能体中的可观测性悖论
DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents
摘要
动态柔性作业车间调度问题(DFJSP)神经组合优化的进展目前受制于一种方法学张力:静态基准助长基准过拟合,而未校准的生成器则以随机噪声掩盖算法能力。为解决这一问题,我们提出\textbf{DynaSchedBench},一个严格控制实例生成过程的DFJSP诊断框架。我们的方法不依赖参数采样,而是利用顺序事件空间校准器(Sequential Event-Space Calibrator, SESC),计算一种新颖的调度压力指数(Schedule Stress Index, SSI)来按难度对实例分层。我们证明,SESC在可靠收敛到目标指标的同时,计算效率显著高于演化基线。该框架集成了实例生成、基于快照的仿真、智能体、评估与可视化等模块化组件,从而能够对响应式与前瞻式策略进行严格测试。利用这一经校准的环境,我们识别出基于LLM的调度智能体的关键局限。具体而言,在动态调度的逐步在线决策中,我们发现一种“可观测性悖论”:让智能体以预言机方式获取完整结构信息反而可能降低策略性能,不及简洁信息。此外,尽管token开销巨大,工具增强与精炼策略并不能可靠地提升性能,且大多数LLM智能体无法持续超越强派工基线——它们的表现更像稳健的启发式近似器,而非更优的优化器。
