论文

前沿域级元认知监控LLM:33模型图集

Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

模型评测鲁棒性、公平性与可信度评测

摘要

聚合元认知质量分数掩盖了 MMLU 基准域的模型内差异。我们对来自 8 个模型系列的 33 个前沿 LLM 管理了 1,500 个 MMLU 项目(每个域 250 个,在先验的六域分组下),并使用言语置信度 (0-100) 计算每个模型域单元的 2 型 AUROC。观察总数:47,151。每个具有高于机会聚合监控的模型都显示出不平凡的域级变化。应用/专业知识确实是最容易监控的基准领域(平均 AUROC = .742,在 33 个模型中的 21 个模型中排名前 2);形式推理和自然科学确实是最难的(这两个模型在 33 个模型中的 27 个中排名倒数第二)。三个中间域在统计上无法区分(Kendall 的 W = .164)。主题级一致性分析(域内相似性比 = 0.95)确认六域分组是实用的基准分类法,而不是经过验证的潜在构造。族内轮廓形状聚类对于 Anthropic、Google-Gemini 和 Qwen(排列 p < .0001)很重要,但对 DeepSeek、Google-Gemma 或 OpenAI 则不重要。 Gemma 4 31B 比 Gemma 3 27B 提高了 +.202 AUROC。在二进制 KEEP/WITHDRAW 探针上分类为无效的三个模型在口头置信度下产生了正常的配置文件,证实了探针格式的特异性。 198 个单元格上的 Bootstrap 95% CI 的中值宽度为 0.199。分半总体稳定性 r = .893;配置文件级分半较弱(总中值 r = .184)。这些结果显示了被聚合指标掩盖的稳定的基准域变化,并支持基准阶段域筛选作为在特定应用程序领域部署之前的一个步骤。