论文

The Token Games:用谜题对决评估语言模型推理

The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

模型评测评测方法与指标

摘要

随着模型的改进,评估大语言模型的推理能力变得越来越具有挑战性。人类对难题的管理非常昂贵,尤其是在最近使用博士级领域知识来挑战最有能力的模型的基准测试中。即便如此,人们仍然担心这些问题是否测试了真正的推理,或者在训练过程中是否出现了类似的问题。在这里,我们从 16 世纪的数学决斗中汲取灵感,设计了token游戏 (TTG):一种评估框架,模型通过创建自己的谜题来相互挑战。我们利用编程难题的格式 - 给定一个返回布尔值的 Python 函数,找到使其返回 True 的输入 - 来灵活地表示问题并验证解决方案。然后,我们使用配对决斗的结果来计算 Elo 评级,从而使我们能够相互比较模型。我们在 TTG 上评估了 10 个前沿模型,并与现有基准(例如 Humanity's Last Exam)的排名紧密匹配,而无需任何人为创建谜题。我们还发现,对于当前模型来说,创建好的谜题仍然是一项极具挑战性的任务,而不是通过以前的基准来衡量。总的来说,我们的工作提出了评估推理的新范式,这些范式不能被设计所饱和,并且允许在解决问题的同时测试其他技能的模型,例如创造力和任务创建。

The Token Games:用谜题对决评估语言模型推理
图1:The Token Games中推理对决示意。两个语言模型轮流扮演出题者(创建谜题挑战对手)或解题者(尝试找出正确答案)。出题者在一轮中得分需满足:设计出一个谜题、给出正确解法、并使对手未能解开挑战。谜题表示为返回布尔值的Python函数,挑战在于找到使其返回true的输入。这样我们便能验证出题者与解题者双方的解题尝试,并在固定轮数后判定每一轮及整场对决的胜负。