论文

自回归生成中自校正盲点的光谱起源

Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation

模型评测模型行为与机制分析

摘要

大型自回归语言模型表现出自我纠正盲点:当归因于外部源时,它们可靠地修复相同的错误,但无法修复自己输出中的相同错误。先前的工作通过受控错误注入、错误深度分解、基于强化学习的验证器-校正器训练和内在自我验证,从经验上记录了这种现象,但没有提供正式模型来解释为什么生成词元会抑制检测其错误的能力,没有校正标记的定量激活条件,也没有为基于强化学习的自我校正提供收敛保证。我们用 SPARC(一种自回归生成中的自校正谱代数理论)弥补了这些差距。我们将误差传播算子定义为残差流上每步注意力雅可比行列式的乘积,并证明当且仅当该算子的谱半径至少为 1 时,才会出现盲点。我们得出了一个尖锐的激活阈值,作为光谱半径的函数,校正标记必须超过该阈值,恢复使用简单的“等待”标记观察到的 89.3% 的盲点减少。我们进一步证明,当且仅当验证器-校正器耦合矩阵的谱范数低于 1 时,基于强化学习的验证器-校正器训练以与样本数平方根上的平方耦合强度成正比的速率收敛,并且该标准在残差流自回归模态中保持不变,统一文本 LLM 和自回归图像和视频生成。跨四个主干网和视觉自回归探针的实验验证了每个定理,光谱预测与测量的盲点率匹配在 3.2\% RMSE 范围内。