论文
具有可预测的缩放定律和可证明的推理优势的分层语言模型
A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning
摘要
我们引入了一系列具有层次结构的合成语言(由树上的广播过程生成),可以精确分析上下文长度和推理在自回归生成中的作用。我们分析方法的核心是用 \emph{exact $k$-gram ansatz} 代替上下文长度为 $k$ 的 Transformer,然后我们根据经验验证这一替换。使用这个 ansatz,我们对由训练模型产生的序列的分布统计得出显式渐近预测,并在两种设置中实例化。对于 \emph{Ising 广播过程}(一种软约束语言),我们证明生成的和的方差在上下文深度中呈对数线性缩放,并且其峰度收敛于高斯的峰度 - 两者都偏离任何亚线性上下文的真实语言。对于冻结状态下的 \emph{着色广播过程}(一种硬约束语言),有界上下文自回归产生的序列很可能与底层树的 \emph{any} 有效着色不一致。这些结果共同意味着忠实采样长度 $n$ 序列所需的上下文长度的 $Ω(n)$ 下限。相比之下,我们证明仅具有 $θ(\log n)$ 工作记忆的自回归 \emph{reasoning} 模型可以从真实语言中精确采样 - 指数级改进。我们通过在合成语言上训练的 Transformer 来实证确认下限预测和基于推理的上限;经过训练的模型可以在各种上下文大小范围内定量地跟踪我们的渐近预测。