论文

GEB-Bench:多种声音讲述的抽象结构

GEB-Bench: Abstract Structures Told in Many Voices

模型评测基准与评测资源

摘要

模型可以观察河流三角洲和闪电并发现它们共享一个结构吗?我们引入 GEB-Bench,这是一个基准,其单位是一个抽象的结构主题——自我参照、奇怪的循环、莫比乌斯扭曲——本着哥德尔、埃舍尔、巴赫的精神。每个主题都以多种声音讲述:一个自然场景,其构成是结构;一个民间故事,其讲述通过可机械检查的形式装置、数学定理和程序框架来实现;表面参数被声明为干扰变量并且从未被评分。主题、声音以及它们之间的结构变化形成了一个小的跨模态类别,GEB-Bench 的任务就是它的问题。评估十二个开放和专有模型,我们发现抽象失败是合法的。核心发现是识别和跨语音映射之间的差距:模型识别一个语音内的结构远比它们跨语音携带结构要好;每个模型都缴纳这种税,并且足够强大的映射来缩小它只出现在前沿层。有两种模式支持它。与测量的感知几何相比,错误与设计的形式几何更加一致,并且来自不同供应商的前沿模型趋于相同的错误答案;表面的复杂性对每个读取结构的模型都造成了负担,容量购买的是空间而不是免疫力。 GEB-Bench 是完全生成的,并随其管道一起发布。