论文

3-9B 开放权重指令调整 LLM 中的言语置信度饱和度:预先注册的心理测量效度筛查

Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen

模型评测评测方法与指标

摘要

口头置信度启发广泛用于从 LLM 中提取不确定性估计。我们测试了七个指令调整的开放权重模型(3-9B 参数,四个系列)是否产生言语置信度,该置信度在贪婪解码的最小数字引发下满足项目级 2 类区分的最低有效性标准。在一项预先注册的研究(OSF:osf.io/azbvx)中,在消费硬件上 Q5_K_M 量化的 8 个模型中,在数字(0-100)和分类(10 级)诱导下对 524 个 TriviaQA 项目进行管理,产生 8,384 项确定性试验。对每个模型格式单元应用心理测量有效性筛选。所有七个指导模型在数字置信度上均被分类为无效(H2 确认,7/7 与预测 >=4/7),平均上限率为 91.7%(H1 确认)。分类启发并不能挽救有效性。相反,它扰乱了七种模型中六种的任务表现,导致准确率低于 5%(H4 未得到证实)。 词元级 对数概率不能有效地预测观察到的方差制度下的言语置信度(H5 确认,平均交叉验证 R^2 < 0.01)。在推理蒸馏模型中,推理轨迹长度与置信度表现出很强的负偏相关性(rho = -0.36,p < .001),这与推理污染效应一致。这些结果并不意味着内部不确定性表示不存在。他们表明,在这种模型大小的情况下,最小的口头诱导无法在输出接口处保留内部信号。心理测量筛查应先于此类信号的任何下游使用。