论文
贝叶斯重复惩罚:逆转自回归语言模型注意力坍缩的相邻条件概率原理性框架
Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models
摘要
自回归语言模型的注意力坍缩——表现为模型陷入自我强化吸引子的重复词元循环——是一种顽固病态,现有解码期启发式方法未能从根源上解决。我们提出一个原理性框架,通过相邻条件概率构造,将词元的观测频率与其语料库先验相比较,从而惩罚或补偿由坍缩生成模式产生的异常置信。所得的自归一化惩罚比率 $R=f(m,n,p)/f(np,n,p)$ 无需特设标准化,并具有零近似误差的闭式logit偏移。该修正与损失梯度隔离,并通过指数移动平均累积到冻结的输出层偏置中,可作为已坍缩模型的修复机制部署,而无需对标准训练流水线进行侵入式改动。在一个1.5B参数模型上的实验验证表明,冻结偏置机制能够挽救已陷入坍缩吸引子的模型,将2-gram重复率从0.073降至接近0,同时保持生成质量。