论文

AIPsy-Affect:一种无关键字的临床刺激测试集,用于语言模型中情感的机制可解释性

AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models

模型评测基准与评测资源

摘要

大语言模型 中情感的机械可解释性研究——线性探测、激活修补、稀疏自动编码器 (SAE) 特征分析、因果消融、转向向量提取——取决于包含所测试情感的单词的刺激。当探测器触发“我很愤怒”时,尚不清楚模型是否检测到愤怒或检测到“愤怒”一词。这两种解读对于每一个关于情绪回路、特征和干预的下游主张都有非常不同的结果。我们发布了 AIPsy-Affect,这是一个包含 480 项临床刺激的组合,可消除刺激水平上的混淆:192 个无关键字的小插图仅通过叙述情境唤起 Plutchik 的八种主要情绪中的每一种,192 个匹配的中性控制共享角色、背景、长度和表面结构,并通过手术消除了影响,加上中等强度和判别有效性的分裂。匹配对结构在强有力的方法论保证下支持线性探测、激活修补、SAE 特征分析、因果消融和转向向量提取:任何将临床项目与其匹配中性项目区分开来的内部表示都不能基于情感关键字存在来这样做。三种方法的 NLP 防御组合——词袋情感、情感类别词典和上下文 Transformer 分类器——证实了这一属性:词袋方法只能看到情境词汇,而上下文分类器可以检测情感 (p < 10^-15),但无法识别类别(在关键字丰富的控件上为 5.2% top-1 vs. 82.5%)。 AIPsy-Affect 将我们早期的 96 项测试集 (arXiv:2603.22295) 扩展了四倍,并在 MIT 许可下公开发布。