论文

利用布鲁姆分类法线性探测LLM认知复杂性的机制可解释性

Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy

模型评测模型行为与机制分析

摘要

大语言模型的黑盒特性要求超越表面性能指标的新型评估框架。本研究以布鲁姆分类法(Bloom's Taxonomy)为分层透镜,考察认知复杂度的内部神经表示。通过分析不同LLM的高维激活向量,我们探测从基础回忆(Remember)到抽象综合(Create)的不同认知层次在模型残差流中是否线性可分。结果表明,线性分类器在所有布鲁姆层次上达到约95%的平均准确率,为认知层次编码于模型表示的线性可及子空间提供了有力证据。这些发现提供了证据:模型在前向传播的早期就处理提示的认知难度,其表示随层数加深而愈发可分。

利用布鲁姆分类法线性探测LLM认知复杂性的机制可解释性
图 1:实验流程概述,从数据集构建和激活提取到逐层线性探测。