论文

可检验人类知识的时间胶囊:在一个免费的本地模型中检验41年的《Jeopardy!》题目

Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model

模型评测模型能力评测

摘要

2011 年,IBM 的沃森就像一个密封的胶囊,里面装有那个时代的可查询知识。其DeepQA系统击败了人类最强的Jeopardy!冠军,但让它这样做的知识存在于一个运行在 POWER7 服务器集群上的、包含数十亿文档的语料库中,在构建时被冻结,无法移动或复制。我们证明,同样类型的人工制品,一种文化可以回答的快照,现在是可移植的并且基本上是免费的。我们针对完整的开放 Jeopardy! 评估单个 9 GB 开放权重模型(Qwen2.5-14B,4 位)。线索数据集,涵盖 1984 年至 2025 年所有 41 个广播季的 529,939 条线索。据我们所知,这是第一次在整个语料库上运行模型。 41年仅标志着问题收集的时间。他们测试的内容更加古老和广泛:一种文化认为值得了解的人类常识知识的积累,从古代历史和消逝的语言到科学、文学和地理,每个项目都有经过验证的答案。该模型在严格的强制响应协议下通过精确和模糊匹配回答了 67.0% 的所有线索,并且在事实类别上超过了 85%。我们将训练数据暴露视为两个系统共享的东西,而不是语言模型特有的缺陷。事实上,沃森的情况更为极端。它的语料库是为了包含《危险边缘》的答案而组装的,它是根据过去的线索进行调整的,它无法回答除精选分布之外的任何内容。决定性的考验是模型是否能够回答构建时不存在的线索。根据训练截止后公布的线索,本地模型占 65%,Claude Opus 4.8 占 95%,而 Watson by Construction 得分为零。从服务器机房转移到可以密封在时间胶囊中的文件后,该功能仍然存在,并且与 Watson 不同的是,它不会冻结在自己的时刻。

可检验人类知识的时间胶囊:在一个免费的本地模型中检验41年的《Jeopardy!》题目:论文配图
图1:五个开放变压器模型(批录1 384-Clue样本,法官检索)相对于模型大小的精确度,并附有Watson参考线。外卖不是那么大, 因为在这个带子里, 关系松散, Phi - 3-14B 追踪的模型要小得多, 但是每个在消费者经营范围内的模型 都复制了华生级的精度。