论文

魔鬼在频谱里:经拓扑正则化旁路缓解LLM表示坍缩

The Devil is in the Spectrum: Mitigating Representation Collapse in LLMs via Topologically Regularized Side-Path

模型架构Transformer

摘要

大语言模型(LLM)从根本上受表示坍缩制约——这一瓶颈严重损害长上下文表现。我们识别出现有方法可能漂移进两种病态极端:同质化坍缩(如注意力汇致秩亏)与孤立坍缩(如局部注意力致上下文断连)。经注意力动力学的谱分析,我们导出混合效率(谱隙)与信息容量(有效秩)之间的内在权衡,标准机制难以平衡。为解决该两难,我们提出拓扑正则化旁路(TRSP),一个实现谱平衡的非侵入式架构干预:TRSP采用无参数的三角盒机制、经轻量的长度感知门缩放,正则化token交互拓扑;通过整合保持有效秩的近端耦合与支持非退化混合的远端传播,TRSP在不改动核心注意力的情况下促成几何上更健康的转移算子。实验显示在通用能力与长上下文基准上的显著改进。 notably,在训练长度8倍的NoLiMa上,TRSP保持83%准确率,较Differential Transformer与Gated Attention分别高出约30与50个百分点。代码见https://github.com/Eziotao-tyd/TRSP。

魔鬼在频谱里:经拓扑正则化旁路缓解LLM表示坍缩:论文配图
图 3:TRSP 概述。左:TRSP 作为并行分支的整体架构。中:长上下文门(上)和 triBox 机制(下)的详细实现。右:分层连接模式显示带宽如何跨层呈指数扩展 (2ℓ2^{\ell})。