对齐税:对齐 LLM 中的响应同质化及其对不确定性估计的影响
The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation
摘要
RLHF 对齐的语言模型表现出响应同质化:在 TruthfulQA (n=790) 上,40-79% 的问题在 10 个 i.i.d 中产生单个语义簇。样品。在受影响的问题上,基于采样的不确定性方法的判别力为零(AUROC=0.500),而自由词元熵保留信号(0.603)。这种对齐税与任务相关:在 GSM8K (n=500) 上,词元熵达到 0.724(Cohen 的 d=0.81)。基础与指令消融证实了对齐的因果作用:基础模型显示出 1.0% 的单簇率,而指令模型则为 28.5% (p < 10^{-6})。训练阶段消融(Base 0.0% -> SFT 1.5% -> DPO 4.0% SCR)将原因定位到 DPO,而不是 SFT。对四个模型家庭的跨家庭复制表明,调整税的严重程度因家庭和规模而异。我们在 22 个实验、5 个基准、4 个模型系列和 3 个模型尺度 (3B-14B) 中进行了验证,在三个 DeBERTa 尺度(全部约为 0.51 AUROC)下使用 Jaccard、嵌入和基于 NLI 的基线。使用两个独立嵌入系列的交叉嵌入器验证排除了耦合偏差。 WebQuestions 上的跨数据集验证 (58.0% SCR) 证实了超越 TruthfulQA 的泛化能力。核心发现——响应同质化——是独立于实现且无标签的。受此诊断的启发,我们探索了正交不确定性信号上最便宜的优先级联(UCBD)。选择性预测将 GSM8K 准确率在 50% 覆盖率下从 84.4% 提高到 93.2%;弱相关边界 (|r| <= 0.12) 可节省 57% 的成本。