论文
大语言模型 对自己的反应过于自信
Large Language Models Are Overconfident in Their Own Responses
摘要
先前的工作表明,指令调整的 大语言模型 (LLM) 的校准不如其基本预训练的对应物。然而,人们对常用聊天模板对会话 LLM 校准的影响知之甚少。在这项工作中,我们通过解耦 后训练 算法和聊天格式的影响来研究驱动这种错误校准的机制。我们发现,虽然指令调整从根本上损害了校准,但聊天模板通过“所有权偏见”加剧了问题——模型对自己的答案比对用户提供的相同答案更有信心。最近对六个开放权重 LLM、三个基准和三个置信度启发方法进行的广泛实验表明,模型为其自己的响应分配了高达 26% 的置信度。利用这种洞察力,我们提出了一种简单的推理时间策略:将模型的答案构建为置信期间的用户输入。这种方法显着减少了过度自信,并将校准提高了 26%,而无需重新训练,从而缩小了基础模型和指令调整模型之间的差距。