论文

大语言模型 中功能元认知的分解和引导

Decomposing and Steering Functional Metacognition in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地表现出表明其评估环境意识的行为,通常在基准设置中调整其推理策略。先前的研究表明,这种评估意识可能会扭曲绩效衡量结果。然而,目前尚不清楚这种现象是否反映了单个行为工件或模型内更深层次的内部结构。我们建议 LLM 维护功能元认知状态的可分解空间:内部变量编码因素,例如评估意识、自我评估能力、感知风险、计算量分配、受众专业知识适应和意向性。通过跨多个推理模型的残差流分析,我们证明这些状态可以从内部激活线性解码,并表现出不同的分层轮廓。此外,通过沿着探针导出的方向引导模型激活,我们表明每个功能元认知状态以可分离的方式因果地调节推理行为,影响跨任务的冗长性、准确性和安全相关响应。我们的研究结果表明,基准绩效不仅反映了任务能力,还反映了特定功能元认知状态的激活。我们认为,理解和控制这些内部状态对于推理模型的可靠评估和部署至关重要,并且我们为研究人工系统中的功能元认知提供了一个机制框架。我们的代码和数据可在 https://github.com/xlands/meta-cognition 上公开获取。