论文
测量 AI 的元认知
Measuring the metacognition of AI
摘要
稳健的决策过程必须考虑到不确定性,尤其是当选择涉及固有风险时。由于人工智能(AI)系统越来越多地集成到决策工作流程中,管理不确定性越来越依赖于这些系统的元认知能力;即他们评估自己决策的可靠性和规范自己决策的能力。因此,采用稳健的方法来衡量人工智能的元认知能力至关重要。本文主要是一种方法论贡献,主张采用meta-d'框架或其无模型替代方案,作为评估人工智能元认知敏感性的黄金标准——生成区分正确和错误反应的置信度的能力。此外,我们建议利用信号检测理论(SDT)来衡量人工智能根据不确定性和风险自发调节决策的能力。为了证明这些心理物理学框架的实用性,我们对三种大语言模型(LLM)——GPT-5、DeepSeek-V3.2-Exp 和 Mistral-Medium-2508 进行了两个系列的实验。在第一个实验中,大语言模型进行了初步判断,然后进行了置信度评级。在第二种情况下,大语言模型仅进行初步判断,而我们则操纵与任一响应相关的风险。一方面,应用meta-d'框架使我们能够沿着三个轴进行比较:将LLM与最优性进行比较,在给定任务上比较不同的LLM,以及在不同任务中比较相同的LLM。另一方面,SDT 使我们能够评估大语言模型在风险较高时是否会变得更加保守。
