论文
通过对语言模型的输出分布对其内部状态进行采样而引入的误差的几何关系
A geometric relation of the error introduced by sampling a language model's output distribution to its internal state
摘要
GPT 风格的语言模型对生成点处的单个标记更改很敏感,其中预测的概率分布分布在多个标记上。将这种敏感性视为几何属性,我们推导出 $\mathfrak{so}(n)$ 值的 1-形式,该形式仅取决于词元嵌入的几何形状。尽管有这种纯粹的几何起源,我们表明它的曲率在语义上是有意义的:在国际象棋推理任务中,曲率与现成的指令调整模型的世界模型耦合,变换按棋盘区域进行聚类并尊重棋子的重要性。我们的研究结果表明,词元空间几何直接反映了模型内部如何表示问题。