论文
诺亚方舟的知识索引
Knowledge Index of Noah's Ark
摘要
大语言模型的知识基准面临三个问题:规模驱动的设计,无法实现学科代表性;允许惰性共识的固定支付注释;以及有限测试预算下未经审计的排名不稳定。我们引入了 KINA,这是一个涵盖 261 个细粒度学科的 899 项基准,有两个正式结果。首先,我们将代表性作为专家引出的锚点上的覆盖式目标,并通过代理来操作学科代表性,产生 (1-1/e) 贪婪近似(命题 1);该保证适用于代理人,而不是人口代表性。其次,我们证明了奖金酒吧锦标赛在发布评论质量方面弱于 FOSD 主导固定支付,激励兼容性阈值 B > Delta C / Delta p_min(定理 1)。通过评估 13 个实验室的 42 个模型,排名第一的模型 Gemini-3.1-Pro-Preview 达到 53.17%,其次是 Claude-Opus-4.6,达到 49.92%,GPT-5.4 达到 48.55%,在饱和度以下还有很大的空间。完整的排行榜显示了分层结构,而不是平滑的总顺序:小前沿层位于 48% 以上,密集的强模型层大约覆盖 38-45%,而低性能模型仅略高于 10% 的机会基线。在五种工具使用评估中,工具增强加起来高达 5.17 分,不同模型的增益差异很大。我们报告引导排名稳定性统计数据,以使有限预算方差明确并阻止对相邻排名的过度解释。
