论文
深度循环Transformer中的逐token不动点收敛
Per-Token Fixed-Point Convergence in Depth-Recurrent Transformers
摘要
深度循环Transformer把权重绑定的核心施加可变次数,既往工作表明以随机递归次数训练可产出一个跨推理深度范围可用的检查点。我们追问这样的模型对每个token实际计算了什么,并直接测量。在FineWeb-Edu上训练的1.35亿级模型上:循环状态收敛到逐token不动点——相继输出KL散度均值从第二次循环的3.9e-1降到第十六次的8.5e-6,逐token状态变化同步衰减。关键在于该收敛并非跨token均匀:中位token在第6循环收敛,而约10%的token在训练平均深度8处仍在更新,平均收敛深度按token类型排序(空白最浅、实词最深)。这种逐token变异是本文的中心对象。我们显示它可直接读出且读出优于学习预测:一个免训练规则——每个token输出稳定即停——以平均4.94循环达到均匀深度8的质量(平均深度降38%),并在平均深度范围内匹配均匀深度;而在同一模型收获的收敛标签上训练的线性路由器需要近乎全深度且无削减。使之可能的弹性在此复现为背景(验证损失从1循环的3.80单调降到8循环的3.20并稳定到32循环)。我们以三点墙钟括号报告平均深度作为FLOP代理而非实测加速,不做FLOP匹配的持平声明,并注明分配结果确立于单一规模与种子。完整研究在单张RTX 4090上约100 GPU小时完成。
