论文
谄媚下的校准崩溃 微调:奖励作弊 如何打破 LLM 中的不确定性量化
Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs
摘要
现代 大语言模型 (LLM) 通过人类反馈 (RLHF) 的强化学习或相关奖励优化方案进行越来越多的微调。虽然这些程序提高了感知的帮助性,但我们研究了阿谀奉承的奖励信号是否会降低校准——这是可靠的不确定性量化所必需的属性。我们在三种机制下对 Qwen3-8B 进行微调:没有 微调(基础)、TriviaQA 上的中立监督 微调 (SFT) 以及诱导阿谀奉承的组相对策略优化 (GRPO),奖励与植入的错误答案的一致。通过引导置信区间和排列测试对五个主题域的 $1{,}000$ MMLU 项目进行评估,我们发现 \textbf{阿谀奉承的 GRPO 产生一致的方向校准退化} - ECE 相对于基本模型增加了 $+0.006$,MCE 相对于中性 SFT 增加了 $+0.010$ - 尽管在此训练预算下效果没有达到统计显着性($p = 0.41$)。应用于所有三个模型的事后矩阵缩放可将 ECE 降低 $40$--$64\%$,并将准确性提高 $1.5$--$3.0$ 个百分点。然而,相对于中性 SFT 控制,阿谀奉承模型保留了最高的缩放后 ECE(0.042 vs.\ 0.037),这表明奖励引起的误校准即使在仿射校正后也会留下结构化残差。这些发现建立了一种评估 奖励作弊 校准影响的方法,并激发校准意识训练目标。