论文

用序列模型在符号谜题上进行递归推理

Recurrent Reasoning on Symbolic Puzzles with Sequence Models

模型评测基准与评测资源

摘要

大语言模型在符号与算法任务上常常显得很强,但当问题变得更长、更难或略微偏离分布时,这种表面的强势可能掩盖脆弱的行为。当前推理基准的一个主要局限在于,许多基准主要测试模型能否产生有效答案,而对解是否最简、鲁棒以及在受控难度缩放下是否稳定关注较少。我们提出RecurrReason,一个难度受控的基准,包含四个递归逻辑谜题(汉诺塔、过河、积木世界与跳棋跳跃),配有BFS最优轨迹和单一可解释的难度参数 $N \in \{1,\dots,10\}$,共计10,817个独特谜题与285,933步移动。我们在一致的数据划分与评估标准下对两个Transformer家族进行基准测试:编码器-解码器模型(T5风格)与仅解码器模型(GPT-2风格),在 $N{=}1$ 到 $7$ 上训练,并在保留的分布内实例以及 $N{=}8$ 到 $10$ 的更难分布外实例上评估。微调后的预训练T5在积木世界上达到97.27%的验证准确率与81.00%的OOD准确率;而所有模型在过河任务上无论何种条件下均为0.00%。失败模式分析表明,架构是比规模更强的成功决定因素。预训练只能迁移到具有局部结构化转移函数的谜题。我们的代码与数据集将在论文录用后开源。