论文
圆面包还是长棍面包?任务拓扑、长度泛化与推理踪迹收益的研究
Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces
摘要
近年来推理模型进展迅猛:这类神经网络会在产出最终输出前先生成中间推理踪迹(RT)。尽管进展迅速,我们对 RT 如何支持推理以及该范式局限的认识仍不完整。为增进理解,我们提出 PITA:一个包含超过 2300 万条命题逻辑语句及其对应证明的新型大规模数据集。作为鲁棒推理的基准,我们聚焦长度泛化:若模型在证明长度不超过固定值的语句上训练判定真假,它对需要更长证明的语句泛化得如何?我们提出 (1) 任务深度与 (2) 任务广度两个概念,分别度量 (1) 求解任务中一个样例所需的步骤数与 (2) 一个任务中不同样例的数量。我们在 PITA 的不同子集上变化这两个量,发现 RT 模型在宽而浅的子集上泛化良好,而在窄而深的子集上相对于非 RT 基线出现退化。为判断结果是 PITA 特有还是反映一般现象,我们将结果与基于三段论的简单合成任务进行比较。所得理论提示了限制 RT 模型在深任务上表现的基本缩放规律,并凸显其在宽任务上的泛化优势。总体而言,我们的发现揭示了使用推理踪迹固有的根本收益与局限。
