论文

OR 对于 AI 的 OR:将大语言模型路由到 OSCAR 框架内的自动扶梯

OR for AI That Does OR: Routing LLMs up the Escalator inside the OSCAR Framework

智能体系统Agent Harness

摘要

大语言模型可以将业务描述转换为优化模型,但可执行代码可能会歪曲约束或目标。然后,求解器可以返回错误问题的最佳解决方案。即使解决方案满足预期的操作规则,也可能存在更好的计划。对于重复使用优化建模的组织来说,基于大语言模型的框架应该以低成本生成准确的公式,并且最好在本地运行。我们研究如何验证改进并在价格和能力不同的大语言模型之间分配尝试。我们开发了 OSCAR(通过模拟器、编码器和审阅者进行优化建模),它使用根据标记的决策示例进行认证的离线模拟器来比较候选者并继续搜索超出可行性的内容。我们将寻找下一个经过认证的改进建模为在未观察到的困难下的顺序决策:呼叫哪些大语言模型以及何时停止。在简化的已知先验设置中,我们给出了按成本顺序升级最佳的条件。对于一般菜单,我们获得事先免费的竞争保证。在五个基准问题上,OSCAR 使用两个小型开放权重 LLM(每个都可在单个 GPU 上本地部署)在报告的设置下实现了 95% 到 100% 的准确率。他们的单次尝试准确率平均为 29% 和 48%。每个问题运行五次,Codex 和 Claude Code 的平均词元成本分别是 OSCAR 的 3.1 和 5.8 倍。 OSCAR 支持本地或云端的开放权重模型,具体取决于预算和保密要求。公司应保留可行和不可行决策的标记决策示例,以阐明简单语言的操作规则。当大语言模型的解释与这些标签相冲突时,OSCAR 会遵循这些标签。随着 LLM 能力和价格的变化,OSCAR 简单的操作规则和可调整的设置可帮助公司调整其模型选择并从这些进步中受益。