论文
The Token Games:用谜题对决评估语言模型推理
The Token Games: Evaluating Language Model Reasoning with Puzzle Duels
摘要
随着模型的改进,评估大语言模型的推理能力变得越来越具有挑战性。人类对难题的管理非常昂贵,尤其是在最近使用博士级领域知识来挑战最有能力的模型的基准测试中。即便如此,人们仍然担心这些问题是否测试了真正的推理,或者在训练过程中是否出现了类似的问题。在这里,我们从 16 世纪的数学决斗中汲取灵感,设计了token游戏 (TTG):一种评估框架,模型通过创建自己的谜题来相互挑战。我们利用编程难题的格式 - 给定一个返回布尔值的 Python 函数,找到使其返回 True 的输入 - 来灵活地表示问题并验证解决方案。然后,我们使用配对决斗的结果来计算 Elo 评级,从而使我们能够相互比较模型。我们在 TTG 上评估了 10 个前沿模型,并与现有基准(例如 Humanity's Last Exam)的排名紧密匹配,而无需任何人为创建谜题。我们还发现,对于当前模型来说,创建好的谜题仍然是一项极具挑战性的任务,而不是通过以前的基准来衡量。总的来说,我们的工作提出了评估推理的新范式,这些范式不能被设计所饱和,并且允许在解决问题的同时测试其他技能的模型,例如创造力和任务创建。
