论文

CBMAS:基于激活引导的认知行为建模

CBMAS: Cognitive Behavioral Modeling via Activation Steering

模型评测模型行为与机制分析

摘要

大语言模型(LLM)在各不相同的提示、层和上下文中编码认知行为的方式往往难以预测,使其难以诊断和控制。我们提出CBMAS,一个面向连续激活引导的诊断框架,将认知偏差分析从离散的干预前后对比扩展为可解释的轨迹。通过将引导向量构造与密集的α扫描、基于logit lens的偏差曲线以及层位敏感性分析相结合,我们的方法能够揭示微小的干预强度即可翻转模型行为的临界点,并展示引导效应如何随层深度演变。我们认为,这些连续式诊断在高层次行为评估与低层次表征动力学之间架起桥梁,有助于LLM的认知可解释性。最后,我们在项目仓库 https://github.com/shimamooo/CBMAS 提供了CLI以及覆盖多种认知行为的数据集。

CBMAS:基于激活引导的认知行为建模 配图
图 2:为某一层 L 生成偏置向量,其中绿色与红色向量分别对应支持性与非支持性方向。