论文
算术 OOD 失败在最小 GPT 中分阶段展开
Arithmetic OOD Failure Unfolds in Stages in Minimal GPTs
摘要
算术基准通常会简化为单个保留分数,但该分数可能会合并性质不同的失败。我们研究了一个受控最小 GPT,在详尽的 2 位数加法上进行训练,其中所有局部数字转换都已存在于训练中,并询问为什么 3 位数泛化仍然失败。失败是上演的。首先,存在布局障碍:学习的绝对位置模型在纯 3 位数布局偏移下崩溃,而混合布局暴露是实质上削弱这一障碍的唯一干预措施。其次,在布局修复之后,百位的行为就像进位标志,而不是语义百位数字;目标进位探针会反转相关的 logits 余量,而匹配的额外数据控制则不会。第三,在进位修复之后,剩下的主要瓶颈是条件重组:在所有真 3 位套件上,高条件尾部数据优于匹配控制、仅高数据和仅尾部数据,并且在更大的 2 层桥实验中再次出现相同的排序。重组后的残余错误绝大多数只是十位,并且一项单独的 10 种子后期研究表明,符号感知十位修复将最难的千位进位套件的精确匹配从 0.664 提高到 0.822。因此,我们提供了一种可通过实验测试的算术 OOD 故障分解为布局、进位语义、重组和后十残差阶段的方法。