论文
我、我自己和 $\pi$:评估和解释 LLM 内省
Me, Myself, and $\pi$ : Evaluating and Explaining LLM Introspection
摘要
内省是人类智能的一个标志——评估并推理自身认知过程的能力。内省已在大语言模型(LLM)中显现为一种有前景但存在争议的能力。然而,当前的评估往往无法区分真正的元认知与单纯运用一般世界知识或基于文本的自我模拟。在本工作中,我们提出一个有原则的分类体系,将内省形式化为对模型策略和参数执行特定算子的潜在计算。为分离广义内省的各个成分,我们提出Introspect-Bench,一个为严格能力测试设计的多维度评估套件。结果显示,前沿模型对自身策略表现出特权访问,在预测自身行为方面优于同类模型。此外,我们提供了因果与机制层面的证据,解释了LLM如何在无显式训练的情况下学会内省,以及内省机制如何通过注意力扩散而涌现。