论文
仅仅提出要求是不够的:LLM 置信度校准中的协议敏感性
Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration
摘要
LLM 置信度校准通常通过比较两个信号来评估:标记概率分数和言语置信度。这些信号有时被视为模型不确定性的直接读数,但它们的比较取决于很少明确的测量选择。在主要分析中,我们保持口头置信度诱导固定:单个提示模板、概率尺度和输出格式。然后,我们改变定义语言化与标记比较的测量轴:哪个答案字符串接收标记概率分数,如何从答案标记中读取该分数,以及在哪种条件上下文下测量它。我们在三个开放 7--8B 基础/指令模型系列的四个 QA 基准上评估此设计,并使用更大的 Qwen2.5 变体作为同系列稳健性检查。结果比较对这些选择很敏感:调节上下文会改变设置之间 ECE 间隙的符号或大小,标记读出会产生较小但符号移动的变化,并且更改 ECE 估计器几乎没有影响。在默认的生成答案、裸上下文协议下,指令设置接近奇偶校验,而不是显示言语置信度的较大校准增益。在单独提供的答案分析中,表面上合理的错误答案与提供的黄金答案几乎具有相同的置信度,这表明口头置信度也反映了答案的合理性和出处,而不仅仅是正确性。我们认为,这两种置信信号都应被视为依赖于协议的行为测量,并提供涵盖启发来源、评分答案、标记概率读数和调节上下文的报告清单。
