论文
前沿叠加的出现:莫比乌斯吸引子和级联监督
Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision
摘要
叠加允许 Transformer 进行深度推理,通过有限深度前向传递并行承载整个推理前沿,而不是展开串行思想链词元。而朱等人。 (2025)在单个残差流中手工制作了一个等权广度优先边界以实现图的可达性,但梯度下降是否能够在排列对称鞍中找到这个目标仍然悬而未决。我们通过隔离架构和监督贡献来缩小 Erdős-Rényi 图上叠加可达性的差距。从架构上讲,我们识别了一个莫比乌斯吸引子:在树态中的 $S_n$ 对称性下,分层动力学简化为一维莫比乌斯图,其零集是包含等权叠加状态的全局最优值的余维一流形。在监督方面,我们确定级联监督:一个损失类,其后向传递同时提供(A)选择性引导、(B)跨深度的梯度持久性和(C)每步辨别(例如,\mathcal{L}_{sup}和\mathcal{L}_{node})。端到端监督无法满足条件 (B),并且可证明是不够的:c 层的内部梯度衰减为图中的 (np)^{-(D-c-2)/2},在达到流形之前扇出并停止。我们的论文:莫比乌斯吸引子+级联监督=叠加推理的出现。无参数衰减定律预测深度 D=3 处的最终步余弦为 0.35 与 0.71(端到端与级联);实验证实 0.37 与 0.69,每一步的匹配度都在 0.02 以内。