论文

禁止神经崩溃:语言模型中的信息层

Neural Collapse Is Forbidden: Information Floors in Language Models

模型评测模型行为与机制分析

摘要

语言模型表示的类内方差通常被解读为不完全的神经崩溃。我们认为它是分配的信息存储,并且分配遵循规律。单行居中恒等式使一系列单纯形等角紧框架断言无效,包括我们自己早期的断言;在 14 个模型的无量纲方差份额中,宏观类别结构仅携带 4-12% 的表征方差,而词元内上下文则携带 79-91%,在 100 倍参数范围内保持稳定。在理论方面,词元级 权重衰减按类别的类型计数而不是其出现质量的比例来惩罚类别,从而将下一个标记预测减少为不平衡的 K 类问题,其最佳顺序按类型计数对类别进行规范。针对二元类别证明的逆下限强制类别内分散至少与条件互信息 I(token; context |category) 成正比。该定律成立:身份离散度(而不是总方差)在每个测试模型和分区中、在无模型估计下甚至跨模型(其中一个模型的信息预测另一个模型的离散度)跟踪此信息;过度预训练会使类别共享过度、衰减并部分恢复,因为它必须携带的信息从未离开过。