论文
MIRROR:面向大语言模型元认知校准的分层基准
MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models
摘要
我们提出MIRROR,一个包含四个元认知层级、八项实验的基准,用于评估大语言模型能否利用自我知识做出更好的决策。我们使用五个独立的行为测量通道,对来自8个实验室的16个模型在约250,000个评估实例上进行评估。核心实验在全部模型上运行;需要特殊基础设施的实验则报告明确标注的模型子集。我们发现两个对智能体部署有直接影响的现象:(1)组合式自我预测普遍失败——在原始15模型Exp3-v1集合上,组合校准误差(Compositional Calibration Error)介于0.500到0.943之间(在平衡的16模型Exp3-v2扩展上为0.434到0.758),表明模型无法预测自己在多领域任务上的表现;(2)模型表现出高于随机水平但不完善的领域特定自我知识,却系统性地未能将这种部分觉知转化为恰当的智能体动作选择——外部元认知控制将自信失败率(Confident Failure Rate)从0.600降至0.143(温度0时降低76%;在来自4个实验室的5个模型上、温度0.7时平均降低70%)。为模型提供其自身的校准分数未产生显著改善(p > 0.05);只有架构性约束是有效的。这表明,外部元认知支架——而非改进的自我知识——才是通向更安全自主AI系统的路径。代码、数据与Croissant元数据将随基准一同公开发布。