论文

FlavourBench:用可执行烹饪真值为前沿语言模型排名

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

模型评测基准与评测资源

摘要

开放式的语言模型基准通常继承一个评判者:人类偏好小组、另一个模型,或一个脆弱的精确匹配键。我们提出FlavourBench,一个自动化基准,其中一个版本化的烹饪系统提供稠密、可执行的真值。每个任务给出八种食材并要求一个三食材组合;在模型执行之前,Epicure给所有56种可能的组合打分。我们在一个相同的534任务核心上评测27个前沿端点,涵盖替代、搭配和受限组合。每个被排名的模型在每个面板和家族中恰好有89个有效响应(共14,418个模型-任务单元格),从排行榜中消除了差异性缺失。FlavourBench分数是冻结任务分数的等家族均值。我们使用50,000次锚定簇bootstrap重抽样获得同时95%分数带,并使用100,000次符号翻转抽样对所有351个配对模型比较进行处理,并施加Holm控制。两个独立编制的面板相关系数为r = 0.89(排名rho = 0.80)。Grok 4.6拥有最大的点估计65.1(同时95% CI 61.0–69.2);351个模型对中有101对被区分开。发布内容包括提示、所有组合分数图、原始响应、确切路由、内容哈希,以及一个能重建每个结果的离线验证器。

FlavourBench:用可执行烹饪真值为前沿语言模型排名:论文配图
图4:经Holm校正后的所有成对模型比较。青色表示行模型得分更高;红色表示更低;灰色表示无法区分。