论文
Transformer中隐藏轨迹的预测几何
Predictive Geometry of Hidden Trajectories in Transformers
摘要
仅解码器Transformer仅通过终端下一个词元预测损失进行训练,但该损失通过固定的下游计算限制每个中间隐藏状态。我们通过研究分层的loss-to-go函数来形式化这个约束:通过剩余的Transformer块继续候选隐藏状态而获得的终端损失。围绕成功的验证轨迹,我们表明这些函数的局部二阶几何结构(直到低损耗残差项)由隐藏状态空间上的回拉费舍尔算子控制。其频谱识别输出敏感方向和近似预测零方向,产生残余流的局部可观察子空间。对于因果变换器,相同的几何形状会产生标记曲率分数:目标logits对每个标记隐藏状态的扰动的费舍尔加权敏感性。该分数在目标的因果祖先集之外消失,并由下游雅可比耦合控制,使其成为注意力强度的损失感知替代方案。我们使用无矩阵雅可比向量和向量雅可比乘积来估计这些量,并在 WikiText、OpenWebText 和 FineWeb 上的仅解码器语言模型上评估它们。根据经验,归纳几何预测扰动敏感性,支持非均匀逐层秩分配,产生有竞争力的结构化词元修剪信号,并在添加到更强的自回归蒸馏目标(例如反向 KL 和倾斜 KL)时提高低秩学生模型恢复。这些结果支持Transformer计算的预测几何视图:在成功的轨迹附近,终端损耗会产生一组薄的、各向异性的与输出相关的隐藏状态方向,可以测量这些方向并用于压缩和蒸馏。