论文
元认知探针:面向LLM的五种行为校准诊断
The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs
摘要
元认知探针(Metacognitive Probe)是一项探索性的五任务、15槽位诊断工具,将LLM的信心行为分解为五个行为上相互区分的维度:信心校准(T1-CC)、认知警觉(T2-EV)、知识边界(T3-KB)、校准范围(T4-CR)和推理链验证(T5-RCV)。该工具在N=8个前沿模型和N=69名人类上进行了评估。它受Flavell(1979)以及Nelson和Narens(1990)启发,但运作于可观测的信心-正确性对齐之上;它并非经过验证的跨物种元认知量表,且预设的人类发展假设已被证伪。复合基准(MMLU、BIG-Bench、HELM、GPQA)追问模型是否给出正确回答。对于模型是否知道自己的回答何时出错,它们保持沉默。一个模型可以在复合校准基准上得到80分,却在聚合分数无法显现的狭窄局部严重过度自信。元认知探针正是要暴露这些局部。我们的核心发现是Gemini 2.5 Flash内部47分的分离:任务内校准为专家组最佳(T1-CC = 88;Spearman rho = +0.551,95% CI [+0.14, +0.80],p = 0.005),而跨任务难度预测为专家组最差(T4-CR = 41;在十二个事实性条目上sigma_conf = 1.4)。