论文

通过选择性预测对 LLM 置信信号有效性筛选进行并发标准验证

Concurrent Criterion Validation of a Validity Screen for LLM Confidence Signals via Selective Prediction

模型评测评测方法与指标

摘要

有效性屏幕(Cacioli,2026d,2026e)将 LLM 置信信号分类为有效、不确定或无效。我们测试这些分类是否可以预测选择性预测性能。来自 7 个家庭的 20 个前沿 LLM 在 6 个认知轨迹的 524 个项目上进行了评估。有效模型显示平均类型 2 AUROC = .624 (SD = .048)。无效模型显示平均 AUROC = .357 (SD = .231)。科恩的 d = 2.81,p = .002。各层单调排序:无效 (.357) < 不确定 (.554) < 有效 (.624)。半分叉交叉验证在 1,000 次分叉中产生中位数 d = 1.77,P(d > 0) = 1.0。三层分类占 AUROC 方差的 47%。 DeepSeek-R1 从完全覆盖时的 85.3% 准确率下降到 10% 覆盖时的 11.3%。屏幕预测标准。对于选择性预测,屏幕很重要。