论文

先错后对:统一语言模型中的后期救援和接口故障

Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models

模型评测模型行为与机制分析

摘要

我们研究如何在对齐的语言模型中组装正确性,而不仅仅是最终答案是否正确。在极性控制的最小对上使用逐层差分(DiD)轨迹,我们识别出错误的倾角:在中间层(25-90%深度),内部偏好短暂地接受了错误的答案,并且只能通过后期层校正来挽救。我们通过 17 个模型、三个系列和 64 倍规模 (0.5B-32B) 的 patchscope 式激活移植来验证这一点。以下是四项发现。 (1) 因果错误倾斜的对齐放大是特定于配方的并且是紧急的:它在 Qwen2.5 中出现在 3B,保持较高水平,并在 32B 处达到峰值(t 高达 9.7),在 Llama-3-8B 中反转(t=-2.31),并且位于 Mistral-7B 之间。 (2) 倾角预测真正的压缩失败:高倾角项在后期层低秩压缩、块丢弃或结构化修剪下翻转的可能性高出 3-7 倍,而量化翻转是倾角盲的,这是由后期层消融证实的双重解离。 (3) 下降是可训练的:具有中间层错误裕度惩罚的 LoRA 微调与仅输出的 SFT 精度相匹配,同时将因果下降减少 67-70% 并提高压缩鲁棒性;仅输出 SFT 在完美的表面精度下使因果下降恶化高达 2.8 倍。 (4) 通过受控读出,该现象在自然语言 I/O 中得以幸存:结构损坏故障的倾斜分层在自然主义小插图中非常重要,并且自由形式的脆弱性分为倾斜可审核的后期救援层和倾斜盲界面层。总之,输出级正确性可以隐藏控制压缩风险、后训练 质量和评估失真的后期救援过程。