论文
PotARCin:抽象推理任务中技能习得的多维评测
PotARCin: Multi-Dimensional Evaluation of Skill Acquisition in Abstract Reasoning Tasks
摘要
抽象与推理语料库(ARC)已成为评估AI模型通用抽象推理与流体智力的重要基准。然而,标准ARC评测只考察单一能力:为测试输入生成正确的输出网格。我们认为这种狭窄的格式无法评估真正的抽象技能习得所应带来的多样化能力。我们提出PotARCin,该基准在五个维度上扩展ARC,评估对任务底层抽象规则的理解:定义(Definition)、分类(Classification)、受约束生成(Constrained Generation)、编辑(Editing)与反转(Inversion)。PotARCin采用程序化方法生成新的任务实例,并对给定ARC任务的输入进行变换,从而实现超越固定输入-输出对的动态生成式采样。在ARC-AGI-1训练集上对五个最先进模型的评测中,我们观察到标准ARC评测与PotARCin评测之间存在25至52个百分点的性能差距,且多维度评测会重排在标准准确率下排名相同的模型。我们进一步研究生成式采样的影响、各类损坏的难度以及自一致性问题,发现模型即使在正确陈述了自己形式化的规则之后,也经常与之相矛盾。我们还引入了P-ARC,一个留出的手工制作测试集,模型在其全部五个维度上的准确率仅为1-8%,这凸显了对抽象推理能力进行更全面评估的重要性。
