论文
论强化学习中奖励函数对大语言模型置信度校准的有效性
On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models
摘要
在本文中,我们考虑使用强化学习(RL)训练 大语言模型(LLM)的设置,以同时提高推理准确性并表达其置信度。我们的奖励方案使用两种函数来奖励由 LLM 表达的信心:一种是当 LLM 正确时,另一种是当 LLM 不正确时。如果奖励方案设计不当,LLM 可能会被激励回答错误,这样它就可以确信自己的答案确实是错误的,我们将这种现象称为置信度 奖励作弊。我们提出了不可破解的置信奖励方案的概念,并为 LLM 中的 RL 置信度校准训练定义了一系列此类奖励方案。我们证明了选择性置信度 奖励作弊 可以出现在具有并非不可破解的奖励方案的实际数据集中。我们还证明了对准确性权衡具有最佳校准的奖励方案取决于数据集和应用程序,并建议使用奖励方案作为超参数来根据对应用程序重要的内容来优化权衡。我们的实验代码可在 https://anonymous.4open.science/r/rl-confidence-calibration-9ED4/README.md 中找到。