论文

GIM:通过整合多个认知领域的任务评估模型

GIM: Evaluating models via tasks that integrate multiple cognitive domains

模型评测基准与评测资源

摘要

随着 LLM 基准的饱和,评估界采取了两种增加难度的策略:提高知识需求(GPQA、HLE)或完全删除知识以支持抽象推理(ARC-AGI)。第一个将记忆与能力混为一谈。第二个因素将推理与其重要的实际背景脱节。我们采取不同的方法。接地整合测量(GIM)是 820 个原始问题(615 个公共问题,205 个私人问题)的基准,其中困难来自于整合;个别问题需要在广泛可获取的知识上协调多种认知操作(约束满足、状态跟踪、认知警惕、受众校准),以便推理立足于现实任务,而不受到专业知识的限制。每个问题都是由专家撰写的原创作品,大部分采用评分细则分解的评分(中位数为 6 个独立评判标准)。平衡的公私分离提供了内置的污染诊断。我们在 28 个模型中校准超过 20 万个提示响应对的连续响应 2 参数逻辑 (2PL) IRT 模型,生成稳健的能力估计,即使原始准确性因错误或丢失数据而扭曲,也能正确排序测试配置,从而解决基准报告中的常见挑战。使用这个框架,我们提供了一个涵盖 22 个模型和 47 个测试配置(独特的模型、思维水平对)的综合排行榜,并进行了据我们所知最广泛的已发表研究,研究测试时计算如何在固定基准上与模型能力进行权衡:11 个模型跨越 35 个测试配置。我们观察到,家庭内部的配置选择,例如思维预算和量化,与模型选择一样重要。我们发布了评估框架、校准的IRT参数以及所有公共问题。

GIM:通过整合多个认知领域的任务评估模型
图 15:按主要认知类别(右块)划分的每个模型 GIM 分数 θ \theta 以及整体 θ \theta(左栏)。每个模型一行,重复数据删除到每个基本名称中的最佳变体,并按规范排行榜排序。颜色在以零为中心的发散尺度上对 θ \theta 进行编码。