论文

ORAgentBench:LLM智能体能端到端解决高难运筹学任务吗?

ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?

智能体系统Agent任务评测

摘要

大语言模型日益被部署为可执行环境中多步任务的自主智能体——但它们执行真实运筹学(OR)工作的能力仍不清楚。既有OR评估常把建模与求解解耦——依赖预形式化或纯文本实例——很少测试从运营工件到经验证决策的完整工作流。本工作中——我们介绍ORAgentBench——评估自主智能体在高难端到端运筹任务上表现的执行锚定基准。它含107个人工审查任务——横跨多样运营场景——每个打包在隔离环境中——带自然语言简报、多文件数据、配置工件与要求的提交模式。智能体必须编写并运行求解代码——其提交由隐藏验证器按模式有效性、硬约束可行性与归一化目标质量评估。十四个前沿智能体-模型配置的实验表明当前智能体远未达到可靠的OR实践。最佳智能体仅通过35.51%的全部任务与20.59%的困难任务——且许多可行提交仍低于要求质量阈值。失败分析进一步显示错误由策略性弱点主导——包括遗漏运营规则、脆弱的公式化、弱可行解构造与不足的解改进。OR专属程序性技能提升困难任务可行性——但不能可靠改进解质量或通过率。这些结果提示:OR智能体的进展需要超越貌似合理的优化代码——迈向可靠、高质量的运营决策。

ORAgentBench:LLM智能体能端到端解决高难运筹学任务吗?:论文配图
图 1:ORAgentBench 的动机。现实的手术室工作依赖于协调的多专家工作流程;现有的基准测试单独的阶段,而 ORAgentBench 评估完整的可执行 OR 工作流程。