论文
K-Bench:在真实科学智能体请求上度量模型性能
K-Bench: measuring model performance on real scientific agent requests
摘要
现有的科学人工智能基准大多是为打分而设计的:多选题、附带参考解的精选智能体任务,或具有已知生成结构的模拟器。真实的科学请求则以另一种方式到来:它们欠规范、携带附件、缺乏真值。我们报告 K-Bench 01,一个构建自 K-Dense Web 真实用户流量首轮请求的评测,由九个前沿模型在相同沙箱中端到端完成,共产生 1,602 次完成的智能体运行。三名盲评语言模型评委依据八维度评分细则为每次运行打分。在一套 8 分锚点告知评委“领域科学家稍加修改即可接受该工作”的评分细则下,没有任何模型在全部三位评委那里越过该线。gpt-5.6-sol 的合并均值最高,为 8.04,但其 95% 区间 [7.80, 8.23] 跨越阈值,且三位评委中有两位把 claude-opus-5 排在第一。因此我们把系统排序作为可复现的量来报告,把绝对水平视为量具的属性,并把榜单首位视为未定。在全部 39,934 条评分判定中——八个维度得分加上每次评估的整体分,不含不适用单元——47.6% 低于 8 分阈值。难度在细则各维度上并不均匀:在相同分母和九个模型内部方向一致的情况下,科学准确性平均 6.22,而沟通表达为 7.33。最主要的失败标签是过度宣称,占 31.4% 的评估。我们主张,对科学智能体而言,有信息量的量不是排行榜位置,而是“交付了什么、宣称了什么、产出了什么工件”的联合分布。
