论文

经激活几何的无监督特征挖掘

Unsupervised Features Mining via Activation Geometry

模型评测模型行为与机制分析

摘要

可解释性方法旨在揭示大语言模型(LLM)内部表示的特征。许多既有方法从人类定义概念(可能反映人类偏见)的标注示例出发——然后识别该概念如何在模型内表示——例如在其激活空间中或经其他分解方法。我们介绍经激活几何挖掘(MAG)——简单无监督框架:通过在每个输入p前置相同自然语言指令Q从模型激活中提取推理特征——其中Q定义感兴趣的推理特征——如“这个物体能在沙漠中找到吗?”或“这个提示是否恶意?”。我们在单一读取点用m(Q|p)-m(p)测量指令如何改变模型内部表示。我们探索八种不同MAG。提取的推理特征预测模型自身的世界理解与判断——可被近似为单一激活方向;我们发现某些特征更线性表示、某些较不线性——该线性表示(即向量转向)可通过注入推理特征经激活转向改变LLM决策。最后——我们用相同方法为提示注入分类器探针选择最佳训练数据集:普通激活间相似度与下游性能几乎无关——而基于RFD的相似度取得94.7% Top-1与100% Top-2准确率。