论文

仅仅提出要求是不够的:LLM 置信度校准中的协议敏感性

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

模型评测评测方法与指标

摘要

LLM 置信度校准通常通过比较两个信号来评估:标记概率分数和言语置信度。这些信号有时被视为模型不确定性的直接读数,但它们的比较取决于很少明确的测量选择。在主要分析中,我们保持口头置信度诱导固定:单个提示模板、概率尺度和输出格式。然后,我们改变定义语言化与标记比较的测量轴:哪个答案字符串接收标记概率分数,如何从答案标记中读取该分数,以及在哪种条件上下文下测量它。我们在三个开放 7--8B 基础/指令模型系列的四个 QA 基准上评估此设计,并使用更大的 Qwen2.5 变体作为同系列稳健性检查。结果比较对这些选择很敏感:调节上下文会改变设置之间 ECE 间隙的符号或大小,标记读出会产生较小但符号移动的变化,并且更改 ECE 估计器几乎没有影响。在默认的生成答案、裸上下文协议下,指令设置接近奇偶校验,而不是显示言语置信度的较大校准增益。在单独提供的答案分析中,表面上合理的错误答案与提供的黄金答案几乎具有相同的置信度,这表明口头置信度也反映了答案的合理性和出处,而不仅仅是正确性。我们认为,这两种置信信号都应被视为依赖于协议的行为测量,并提供涵盖启发来源、评分答案、标记概率读数和调节上下文的报告清单。

仅仅提出要求是不够的:LLM 置信度校准中的协议敏感性
图 1:对黄金答案(而不是模型生成的答案)进行标记概率评分会翻转大多数 Instruct 单元的结论。生成答案(主)与黄金​​教师强制标记概率评分下每个(模型、变体、数据集)单元格的语言化与标记差距 g g 的符号,正确性保持固定。蓝色( g < 0 g<0 ):言语表达更好;红色 ( g > 0 g>0 ):token概率更好。逐列颜色变化表示评分选择翻转了结论(13/24 单元格;9/12 指示)。