论文

KWBench:测量知识工作中无提示问题识别能力的基准

KWBench: Measuring Unprompted Problem Recognition in Knowledge Work

模型评测基准与评测资源

摘要

我们推出 KWBench(Knowledge Work Bench)的首个版本,这是一个测量大语言模型无提示问题识别能力的基准:LLM 能否在尝试求解之前先识别出专业情境属于什么问题。现有前沿基准已经饱和,而迄今为止的大多数知识工作评估都可归结为按规范进行的信息抽取或任务完成。KWBench 瞄准的是更前的一步:仅凭原始输入识别情境的主导结构。该基准包含 223 个来自从业者的任务,覆盖并购、合同谈判、临床药学、组织政治、欺诈分析与激励机制设计。每个任务编码一个正式的博弈论模式(委托-代理冲突、信号传递、机制设计失灵、策略性隐瞒、联盟动态、策略相互依赖),并带有结构化标准答案,记录专家对情境的解读以及预期失败模式。模型收到原始数据和任务提示,没有任何关于问题类型的暗示。评分采用由强制性合取检查门控的三层评分细则,强制性标准编码了预判的错误路径。我们评估了 16 个模型。最好的模型在 27.9% 的任务上通过。排名前二的模型在其通过的任务上仅有 31.7% 一致。在前 8 名中,44 个任务恰好只被一个模型解决;跨前 8 名的路由可覆盖基准的 50.7%,几乎是最佳单模型的两倍。在通过的前提下,质量分数趋于收敛(各模型约 83%);无条件分数则不然。同样的模型在被问到时能正确阐述相关的博弈论概念,随后却无法在无提示的情况下加以运用。我们发布 KWBench,以期改变前沿模型在知识工作上的评估方式:衡量它们能否仅凭情境识别出正确的问题,而不仅仅衡量在问题已被替它们框定之后执行得多好。

KWBench:测量知识工作中无提示问题识别能力的基准:论文配图
图4:排名前8模型通过门控集合的两两Jaccard相似度,平均重叠仅29.3%,表明各模型对问题的主动识别差异明显。