LLM 他们知道什么吗?用信号检测理论测量元认知效率
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory
摘要
LLM 置信度的标准评估依赖于校准指标(ECE、Brier 分数),该指标合并了两种能力:模型知道多少(Type-1 准确性)以及其置信信号跟踪该知识的程度(Type-2 元认知敏感性)。我们应用信号检测理论来分解它们,将 词元级 归一化对数概率视为分级置信变量,并将答案正确性视为要判别的状态。我们通过 z-ROC 分析来表征该信号的 Type-2 ROC,包括其不等方差结构,并且 - 由于开放式 QA 的元 d' 效率比没有明确定义,而开放式 QA 缺乏两种替代的 Type-1 决策 - 使用无模型信息测量、归一化元认知信息 (meta-I_2r) 来量化效率。在四项 LLM 和 224,000 个事实 QA 试验中,我们发现:(1) 模型之间的元认知信息相差 1.98 倍,并且不能通过准确性进行预测,TriviaQA 上的排名相关性为 -0.80,自然问题上的排名相关性为 +0.00; (2) 置信信号具有校准指标不可见的模型特定的不等方差结构(z-ROC 斜率 0.78 至 1.18),斜率排序在 NQ 上复制; (3) 效率是特定领域的,每个模型的科学技术最弱; (4) 温度将准确性与元认知信息分离,四个模型中的三个模型几乎持平,而准确性却下降; (5) 元认知信息准确地跟踪基于置信度的弃权所带来的准确性增益 (rho = +1.00),而准确性则不然。所有估计都带有排列零值和引导置信区间。该版本 (v3) 纠正了自动正确性评分器中的差异长度偏差,并针对 1,830 次人工裁决进行了验证; v1 和 v2 中报告的逆精度-效率耦合在重新标记后无法幸存。请参阅第 1 页的版本说明。