论文
语言模型的算术教学法
Arithmetic Pedagogy for Language Models
摘要
我们研究人类数学教学方法是否可以指导语言模型的算术推理训练。基于 GASING 方法(一种印度尼西亚教学法,通过与词元生成的因果顺序一致的从左到右的过程来解决基本算术),我们将每个操作操作为一个计算过程,其执行轨迹被序列化为自然语言思想链(CoT)监督。一个带有印尼语音节凝集 TOBA 分词器的小型 GPT-2 解码器(86M 参数)仅使用下一个分词预测目标从头开始对这些数据进行训练,无需强化学习或基于奖励的优化。监控训练揭示了三个不同的学习阶段,而机械分析——对 CoT 信息图的注意力屏蔽干预、残差流探测和 logits 镜头检查——表明该模型首先内化了一个程序路径,随后发展了一种关联的“心算”能力,无需显式的逐步计算即可检索中间结果。经过训练的模型对遗留问题的准确率达到 80% 以上,并且与更大的语言模型相比具有竞争性的性能,这表明有针对性的、基于教学的训练可以在小规模下产生强大且经济的算术能力。