论文
OenoBench:用于 大语言模型 知识评估的葡萄酒领域基准
OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models
摘要
我们推出了 OenoBench,这是一个葡萄酒领域知识基准测试,包含 3,266 个多项选择题,涵盖六大支柱(地区、葡萄品种、葡萄栽培、酿酒、生产商、商业)和四个难度等级。该语料库由 35 个经过来源验证的抓取工具从政府注册机构(INAO、TTB、OIV)、同行评审期刊和维基百科/维基数据中提取的 38,104 个原子、源锚定事实构建而成。我们的方法论贡献是 LLM 驱动的管道,其中语言模型重新格式化已验证的事实并审核结果,但从不充当事实来源:每个声明都追溯到 URL,每个问题都是由五个生成器系列的五种策略之一生成的,每个问题都由通过 Cohen 的 $κ$ 根据人类金表校准的九代理审计进行评分。评估 16 个前沿配置后,我们发现:(i) 总体准确度跨度为 53%-84%,其中 o3 领先,达到 83.6%; (ii) 推理模式提升集中在 DeepSeek R1 (+6.8pp) 中,而在 Claude Opus 和 Gemini Pro 中不存在; (iii) Anthropic 在自己的问题上显示出 +9pp 的自我偏好,而 Google 显示了 -8pp 的反向偏好; (iv) 前沿开放权重模型与专有推理模型共享成本与准确性帕累托前沿; (v) 每个配置在闭卷可解决项目上获得大约 33pp,揭示了只有上下文切片才能避免的参数回忆上限。我们根据 CC-BY-SA-4.0 发布语料库、审计结果、人工审核应用程序和构建代码。