论文
通过内化学习
Learning through Internalization
摘要
我们研究内化过程,基于神经网络的系统将显式计算过程吸收到自己的权重中,以及它们如何促进学习。我们研究了 Transformer 如何通过内化思想链 (CoT) 词元来内化半自动机的模拟,哪些类半自动机更难内化,并揭示了内化的另一面,即分布外性能的逐渐退化。然后,我们提供了成功内化的第一个可证明的分析:对于学习奇偶性的任务,我们证明了简化的单层 Transformer 首先通过显式 CoT 监督学习目标,然后随着 CoT 词元逐渐删除而内化自回归生成,学习直接计算奇偶性。在没有 CoT 监督的情况下,这项任务在计算上很难从数据中学习。最后,我们讨论通过内化学习如何与 ~\citet{Med+26} 最近引入的 \textit{Positive Distribution Shift} 现象相关。