论文
更深并不总是更好:通过可信层解码减轻对齐税
Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
摘要
大语言模型 (LLM) 中的自回归生成通常从最后一层进行解码,假设更深的表示会产生更可靠的下一个词元预测。我们通过揭示反复出现的猜测-细化-扰动动态来重新审视这一假设:早期层形成粗略猜测,中间层细化与推理相关的语义,最后层可以扰乱这些针对通用或对齐首选标记的精细预测。我们引入了 Confident Decoding,这是一种 无需训练 解码策略,它通过熵引导的保守向后搜索动态选择最可靠的近最终层。我们进一步提供了层选择作为最佳停止问题的理论公式,表明在有界投影噪声和主要的后期对齐扰动下,我们的搜索规则过滤扰动,同时限制相对于预言细化层的损失。密集型和专家混合型 LLM 的实验表明,在具有挑战性的推理基准(包括 GPQA-Diamond、Omni-MATH 和 HLE)上取得了一致的收益,且内存开销为零,延迟增加不到 2%。这些结果表明,动态绕过最后层扰动可以从对齐的 LLM 中解锁更强的推理行为。