论文
A2RBench:一种可形式化验证的抽象推理基准自动生成范式
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
摘要
抽象推理能力反映了LLM提取和应用抽象规则的智力与泛化能力。然而,准确测量这一能力仍然充满挑战:现有基准要么依赖昂贵的人工标注而限制规模,要么有测得记忆而非真正推理的风险。为解决这一问题,我们提出名为A2RBench的自动化流水线,涵盖生成、扩展、评估与分析。具体而言,在生成阶段,LLM创造需要真正推理的多样化任务;在扩展阶段,LLM复用已验证规则并扩展新输入空间以生成任务变体,实现规模化。然而,这样的过程可能引发幻觉。为消除幻觉,我们进一步建立理论框架并证明:程序化验证——检验逆运算是否完美逆转前向运算(循环一致性)——可保证解的唯一性。通过对主流LLM的大量评估,我们发现:(1) 当前LLM在抽象推理上存在根本性缺陷,顶级模型在代表性子集上显著落后于人类(39.8%对68.5%)。(2) 当前LLM生成的3D任务复杂度远不及2D和1D,暴露其对高维任务缺乏理解。(3) 出人意料的是,信息复杂度更高的输入反而可能简化推理过程。
