论文

测量 AI 的元认知

Measuring the metacognition of AI

模型评测评测方法与指标

摘要

稳健的决策过程必须考虑到不确定性,尤其是当选择涉及固有风险时。由于人工智能(AI)系统越来越多地集成到决策工作流程中,管理不确定性越来越依赖于这些系统的元认知能力;即他们评估自己决策的可靠性和规范自己决策的能力。因此,采用稳健的方法来衡量人工智能的元认知能力至关重要。本文主要是一种方法论贡献,主张采用meta-d'框架或其无模型替代方案,作为评估人工智能元认知敏感性的黄金标准——生成区分正确和错误反应的置信度的能力。此外,我们建议利用信号检测理论(SDT)来衡量人工智能根据不确定性和风险自发调节决策的能力。为了证明这些心理物理学框架的实用性,我们对三种大语言模型(LLM)——GPT-5、DeepSeek-V3.2-Exp 和 Mistral-Medium-2508 进行了两个系列的实验。在第一个实验中,大语言模型进行了初步判断,然后进行了置信度评级。在第二种情况下,大语言模型仅进行初步判断,而我们则操纵与任一响应相关的风险。一方面,应用meta-d'框架使我们能够沿着三个轴进行比较:将LLM与最优性进行比较,在给定任务上比较不同的LLM,以及在不同任务中比较相同的LLM。另一方面,SDT 使我们能够评估大语言模型在风险较高时是否会变得更加保守。

测量 AI 的元认知:论文配图
图 S1:假设类型 1 任务的响应正确(绿色;右条)或不正确(红色;左条)或 P⁡(置信度=Ci|类型 1 任务正确或不正确),置信度评级的条件比例\mathchar 29008\delimiter 67273472\text{confidence}\mathchar 12349\mathchar 28995_{\mathchar 29033}\mathchar 12906\text{类型 1 任务的正确或错误}\delimiter 84054785 对于任务 A(第一行)、任务 B(中间行)和任务 C(底行)。详细信息请参见图 1。