论文

SCHEDBench:评估自然语言组合调度中LLM的约束忠实性

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

模型评测基准与评测资源

摘要

本文介绍了一个名为 SCHEDBench 的自然语言基准,用于评估在表面形式变化下组合型调度约束的忠实度。基于标准的调度实例和求解器衍生的可行性与优化性,SCHEDBench 评估大语言模型(LLMs)生成的调度行为是否在各种自然语言(NL)表面形式下保持一致。SCHEDBench 跨越 1,132 个实例,涵盖作业车间调度问题(JSP)、单资源和多资源约束项目调度问题(RCPSP)、护士排班/调度问题和难度各异的课程表编制问题。实例使用领域特定模板、主题实体、词法-句法模板重述以及约束级表面形式变化,参考解决方案验证其可行性与目标优化性。在十三个前沿且开放权重的 LLMs 上,我们发现模型对同一种调度问题的语义等价渲染不一致地保持不变。表面形式变化降低了可行性,并诱导了匹配实例上的硬约束违反上的噪声性偏差。在测试的孤立轴中,约束重排最清晰地表现出噪声性敏感性。

SCHEDBench:评估自然语言组合调度中LLM的约束忠实性:论文配图
图1:SCHEDBench 生成流程概览。