论文

GraphARC:图结构抽象推理综合基准

GraphARC: A Comprehensive Benchmark for Graph-Based Abstract Reasoning

模型评测基准与评测资源

摘要

关系推理是智能的核心,但现有基准通常局限于网格或文本等格式。我们提出GraphARC,一个面向图结构数据抽象推理的基准。GraphARC将抽象与推理语料库(ARC)的小样本变换学习范式推广到图上。每个任务要求从少量输入-输出对中推断变换规则并应用于新的测试图,涵盖局部、全局与分层图变换。与基于网格的ARC不同,GraphARC实例可在多样的图族与规模上批量生成,从而支持对泛化能力的系统评估。我们在GraphARC上评估了最先进的语言模型,观察到明显的局限。模型能回答关于图性质的问题,却常常无法完成完整的图变换任务,揭示出理解-执行鸿沟。在更大实例上性能进一步下降,暴露出扩展障碍。更广泛地说,GraphARC在单一框架内结合了节点分类、链接预测与图生成等方面的要素,为未来的图基础模型提供了有前景的试验场。

GraphARC:图结构抽象推理综合基准:论文配图
图 3. GraphARC 上的总体模型性能。条形图显示完整输出任务(结构化图生成)和基于问题的任务的准确性,分为有关输入(可见图)和输出(推断图)的问题。对于大多数模型,我们观察到理解-执行差距(基于问题>>完整输出)和输入-输出不对称(输入>>输出)。推理模型始终优于直接答案基线。