论文

使用基于 RL 的 微调 减轻 LLM 的阿谀奉承:贝叶斯真值血清方法

Mitigating LLM sycophancy with RL-based fine-tuning: Bayesian Truth Serum approach

模型训练强化学习

摘要

大语言模型 (LLM) 经常表现出\emph{阿谀奉承}:他们根据用户陈述的信念或偏好调整答案,而不是报告他们认为正确的内容,这会降低事实准确性并可能放大错误信息。本文提出了一种减轻阿谀奉承的方法,该方法采用贝叶斯真值血清(BTS)(一种同行预测机制)作为组相对策略优化(GRPO)中的奖励来微调 LLM。 BTS 支付的答案是\emph{令人惊讶地常见},即在受访者中出现的频率比受访者自己预测的要高。我们将模型对一个问题的一组响应视为这些受访者,因此奖励是模型自身输出的函数,并且 微调 既不需要标签也不需要偏好注释。我们证明,在大群体的限制下,阿谀奉承的反应所获得的预期奖励要比诚实的反应低得多。我们还证明,如果整个小组事先就对称回答规则达成一致,它就无法获得比如实报告更高的信息分数。在我们的真/假基准测试中,参考模型在用户压力下的回答翻转率从 23% 下降到 4%,而该压力下的准确度从 80% 增加到 93%。我们的奖励优于 SMART,并且可与合成数据 微调 和精确调整相媲美,这三者都在标签上进行训练。它在交换中花费了相当多的计算,这使得它适合标记数据稀缺的情况。 Peer Truth Serum 也为罕见的答案支付了溢价,但没有得出预测报告,重现了这种效果。因此,在单个 GRPO 组内计算的同行预测奖励减少了没有标签的阿谀奉承,并且比较机制表明,为更罕见的答案支付的溢价推动了这种效果。