论文

Metanym 游戏:不带 真值 的 LLM 基准随其测量的模型而上升

The Metanym Game: An LLM Benchmark Without Ground Truth That Rises With the Models It Measures

模型评测基准与评测资源

摘要

我们引入了一个完全独立的基准测试,不需要 真值,并且随着它测量的模型而上升。语言模型在进行类比和主观评分方面相互竞争;没有任何东西从外面进入。该基准测试再现了 GPQA Diamond,这是一个由专家编写的问题的关键基准测试,r = 0.98,经过审计是否存在泄漏并发现干净。我们假设这两个基准以不同的方式衡量同一件事:语言模型将其知识保存为原型上下文,即在许多主题领域有效的关系模式。 GPQA 将某一领域所需的知识实例化; Metanym 游戏将一种原型实例化为多个领域,生成类比,无需推理。 LLM 的推理功能几乎不会改变游戏的评分,但它会提升需要推导的 GPQA。在游戏中,玩家编写一个上下文模板,其槽位填充了主题域中的一组关键字,实例化了该域的真实描述;实例化是彼此的隐喻,填充相同位置的关键字是元喻,隐喻上是同义的。正确性是逐句确定的。 真值 被事实评级矩阵的 SVD 所取代:它的左奇异向量和右奇异向量将玩家作为法官和生成器进行评级,两个评级来自一个因式分解,据我们所知,这对于 LLM 同行委员会来说是第一次。在主观标准上,评委根据扫频校准锚下的评分一致性进行加权。生成和判断是不同的技能:在这个名单上最强的生成器是中等的判断。由五名最佳选手组成的委员会发布官方评级;它的可竞争席位使其保持最新状态,这是自我改进人工智能的候选转向信号。该论文附有一个验证包,可以重新计算每个数字。