论文
JOR-Bench:大语言模型 的日本运筹学基准
JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models
摘要
我们推出了 JOR-Bench,它是五个日语基准的集合,用于评估 大语言模型 (LLM) 制定和解决运筹学 (OR) 问题的能力。每个基准都是现有英文基准的日文翻译:IndustryOR、MAMO Complex LP、NL4OPT、OptiBench 和 OptMATH,涵盖线性规划、混合整数规划、非线性规划和组合优化等领域的 1,319 个问题。 JOR-Bench 是一个独立于求解器的基准测试,可与任何求解器或编程语言一起使用,由成对的日语问题陈述和预期的数值答案组成。我们在原始英语和新日语版本上评估了七个 LLM,包括多语言通用模型和日语专用模型,并比较了不同语言的性能。对于主要评估,我们使用 OR-Tools 的 Python 接口标准化执行,以使模型输出与开源软件具有可比性和可重现性。我们的结果表明,对于强多语言模型,OR 表述能力在很大程度上是语言中立的;英语和日语之间的总体平均准确度差异仅为-0.3个百分点。然而,错误分析揭示了微妙的跨语言差异,包括某些领域的语用消歧失败,导致模型在日语提示时输出决策变量值而不是目标值。