论文

MEDLEY-BENCH:在人工智能元认知中,规模可以带来评估,但不能带来控制

MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition

模型评测基准与评测资源

摘要

元认知,即监控和调节自己推理的能力,在人工智能基准测试中仍然被低估。我们引入了 MEDLEY-BENCH,这是一种行为元认知基准,它将独立推理、私人自我修正和在真正的模型间分歧下受社会影响的修正分开。该基准评估了来自 12 个家族的 35 个模型,涉及 5 个领域的 130 个模糊实例,并报告了两个互补的分数:Medley 元认知分数 (MMS)(基于反思更新、社会鲁棒性和认知表达的分层聚合)和 Medley 能力分数 (MAS)(源自四种元认知子能力)。结果显示了强大的评估/控制分离:评估能力随着家庭内模型大小的增加而增加,而控制则不然。在对 11 个模型的后续渐进对抗性分析中,我们观察到两种行为概况,即主要根据论点质量进行修改的模型和跟踪共识统计数据的模型。在模型内相对分析(自比评分)下,评估是所有 35 个模型中最弱的相对能力,表明存在系统性的知/行差距。较小和较便宜的模型通常与较大的模型相匹配或优于较大的模型,这表明元认知能力不仅仅是规模的函数。这些发现将 MEDLEY-BENCH 定位为衡量社会压力下信念修正的工具,并表明未来的培训应该奖励经过校准的、成比例的更新,而不仅仅是输出质量。