论文

当 大语言模型 中语言和内部信心出现分歧时

When Linguistic and Internal Confidence Diverge in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

用户经常要求 大语言模型 (LLM) 报告他们的置信度,但尚不清楚这种语言置信度是否跟踪模型的内部置信度。我们通过 8 个分类任务、2 个生成任务和来自三个系列的 30 个模型来研究这个问题。对于分类,我们将语言置信度与基于 logits 的置信度沿三个轴进行比较:关联、幅度一致性和校准。对于生成,我们测试语言置信度是否跟踪基于语义熵的不确定性。轴线经常发散。实例级关联平均较弱,尽管它在更简单的项目和更强的基础模型上有所改进。经过指令调整的模型通常会报告更高的置信度,有时会表现出更高的关联性,但它们也有更大的置信差距和更差的校准。提示设计主要改变报告置信度的分布。态度线索会在不改善对齐的情况下增强信心,而分数样本在避免崩溃的信心值时可以保留排序信号。回归分析表明,置信度分数的分布特性解释了大部分观察到的对齐模式,模型元数据在控制之后发挥的作用较小。这些结果支持语言置信度的有损通道观点。更分散的言语置信度分布可以携带有用的排名信息,但它不会使分数得到校准。因此,在用于下游可靠性管道之前,应使用多轴诊断来评估语言置信度。