论文
功能并不随方差分布:语言模型计算的任务加权坐标系
Function Lives Where Variance Doesn't: Task-Weighted Charts of a Language Model's Computation
摘要
语言模型的计算究竟使用多少维度?在指定功能泛函之前,这个问题并不适定。任务加权坐标系使其变得适定:在功能自身的度量下,针对表征的某个选定功能拟合低维坐标系,从而将蒸馏转化为普通最小二乘问题。在三个模型家族的六个模型、7000万至70亿参数范围内,若要把下一token预测困惑度保持在完整模型的5%以内,需要残差流宽度的70%—90%;这些维度被语言的罕见尾部消耗,而方差分布完全无法预测这一需求:两个方向承载了GPT-2激活方差的90%,却几乎不承载其功能。维度是针对具体功能而言的:模型自身不确定性可从六个坐标读取,而完整预测分布需要数百个坐标;所需维度还随深度增加。这种分离可被利用:当只能保留少量维度时,按功能度量训练的坐标系比基于方差或最优线性压缩更好地保留模型预测。