论文

微型Transformer算术推理中的草稿与分阶段课程

Algorithmic Scratchpads and Curriculum Staging for Arithmetic Reasoning in Tiny Transformers

模型训练模型推理监督微调与指令调优推理策略与问题分解

摘要

自回归大型语言模型 (LLM) 经常难以处理确定性的多步骤算法任务,例如多位数乘法和长除法。在本文中,我们研究了紧凑型“Tiny”Transformers(约 1060 万个非嵌入参数,总共 4930 万个)中的多步算术机制,这些Transformer在四个基本操作(+、-、*、/)的合成数据上进行训练,这些操作以逐步便签本的形式展开。首先,我们建立必要的训练基础:(1) 数据加载器序列填充产生 83% 的梯度饥饿伪影,将准确度从 40% 降至 1%,通过连续序列打包进行修复; (2) 语言预训练是必要的先决条件(没有它<= 2.0%); (3) 现代架构原语(RoPE、RMSNorm、SwiGLU)和稀疏专家混合 (MoE) 相对于基线 GPT-2 显着改进了加法推理。其次,我们证明算法暂存器公式直接决定成功。在 4 阶段分层发展课程中引入确定性的逐位长除法暂存器,可将 4,000 个问题的基准上的个位数除法准确率从 4.0% 显着提高到 86.7%。相比之下,多位数乘法仍然具有挑战性:详细的误差分析表明,虽然模型正确计算了单位数子乘积和位值零,但我们的 FOIL 暂存器失败了,因为它强制在一个步骤中同时求和最多 9 个多位数项,而没有成对的中间累加。最后,我们确定了两个关键边界:在未见过的 4 位操作数上,性能下降至 0.00%,无缓冲训练会导致灾难性遗忘,将除法精度从 86.7% 下降至 0.00%。