论文
反思大语言模型的不确定性评估
Rethinking Uncertainty Evaluation in Large Language Models
摘要
校准是评估LLM置信度的首要标准,但它不够:它容忍平凡的失连贯估计器、依赖评估分布,且不检验该估计能在多大程度上被解读为一个一致的、底层的概率函数。我们真正需要的是LLM置信估计满足连贯概率信念所要求的条件。我们沿三个轴(结构连贯、忠实、有用)形式化这些条件,并将其操作化为C1指标。广泛使用的估计器系统性违反这些条件,尽管看起来校准良好:模型在31%的情况下给逻辑更简单的问题分配更低置信度;降低RMSCE的常见干预使结构违规不变——提示校准与概率有效性正交。RLHF与思维链改善有用性指标却不恢复连贯性。结果表明当前LLM置信估计不能被解读为连贯概率;我们的框架提供测量并弥合该差距的工具。
