论文
Opti-Agent-Bench:在真实商业问题上基准测试端到端优化研发智能体
Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems
摘要
基于LLM的智能体日益被部署求解优化问题,但既有基准在预先结构化的数学表述上评估它们——绕过最关键的挑战:把复杂业务需求转化为正确模型并高效求解。我们提出Opti-Agent-Bench:一个端到端基准,跨完整优化研发管线评估LLM——从理解业务语言描述,经数学建模、算法选择与代码实现,到解决方案报告生成。设计基于三大支柱:(1) 业务语义真实性,带击败模式匹配的反模板陷阱;(2) 模块化评估,跨问题理解、形式化建模、实现与报告做跨模块一致性检查;(3) ORAC双层效度框架,同时确保任务质量与评分诚信。跨多个工业规模任务(整数规划、鲁棒优化、随机规划与非凸优化):我们暴露当前模型的关键失败模式——约束遗漏、模型—代码不一致、报告—实现背离——这些在常规单指标评估下不可见。
