论文

K-Bench:在真实科学智能体请求上度量模型性能

K-Bench: measuring model performance on real scientific agent requests

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

现有的科学人工智能基准大多是为打分而设计的:多选题、附带参考解的精选智能体任务,或具有已知生成结构的模拟器。真实的科学请求则以另一种方式到来:它们欠规范、携带附件、缺乏真值。我们报告 K-Bench 01,一个构建自 K-Dense Web 真实用户流量首轮请求的评测,由九个前沿模型在相同沙箱中端到端完成,共产生 1,602 次完成的智能体运行。三名盲评语言模型评委依据八维度评分细则为每次运行打分。在一套 8 分锚点告知评委“领域科学家稍加修改即可接受该工作”的评分细则下,没有任何模型在全部三位评委那里越过该线。gpt-5.6-sol 的合并均值最高,为 8.04,但其 95% 区间 [7.80, 8.23] 跨越阈值,且三位评委中有两位把 claude-opus-5 排在第一。因此我们把系统排序作为可复现的量来报告,把绝对水平视为量具的属性,并把榜单首位视为未定。在全部 39,934 条评分判定中——八个维度得分加上每次评估的整体分,不含不适用单元——47.6% 低于 8 分阈值。难度在细则各维度上并不均匀:在相同分母和九个模型内部方向一致的情况下,科学准确性平均 6.22,而沟通表达为 7.33。最主要的失败标签是过度宣称,占 31.4% 的评估。我们主张,对科学智能体而言,有信息量的量不是排行榜位置,而是“交付了什么、宣称了什么、产出了什么工件”的联合分布。

K-Bench:在真实科学智能体请求上度量模型性能:论文配图
图1:图形摘要。K-Bench 01 逐字取用178个真实用户会话的首条消息(连同附件),在相同的沙箱中让九个前沿模型将每条消息端到端运行,再由三名对身份设盲的评判者在打开每次运行留下的工件后,对由此产生的1,602次运行进行评分。左侧面板中的文件图标仅示意附件构成,而非按领域的格式细分;语料中最常被附上的格式是 .docx(表30)。图块中的数值为主要结果:最佳模型均值(8.04/10,一个区间跨越可接受线的点估计,且三名评判者中仅一名给出该值;见5.4节,至于达到8分的模型数为何随评判者不同而为零、一或二,见5.2节);39,934项评分判定中低于可接受线的比例(47.6%,图中显示为48%);带有过度声称标签的评估比例(31.4%);以及无模型解决的任务比例(12.4%,图中显示为12%)。下方条带将执行维度均值(6.93)与实质维度均值(6.34)对比,4.2节给出了更严格且分母匹配的版本:在全部九个模型中,科学准确性都比沟通性低1.11分。