论文

“我的名字有很多”:通过稀疏自动编码器剖析助手及其角色

"Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders

模型评测模型行为与机制分析

摘要

语言模型如何在内部表示谁在说话、助理、指定的角色扮演角色或叙述的故事角色,仍有待探索。我们使用用户表达的情感文本和相应的模型响应的数据集来研究说话者的表征。我们将三个生成设置(助手、角色扮演和故事)分解为在转弯边界和代词标记位置提取的稀疏自动编码器特征,并通过不同深度的过滤管道进行选择。我们通过其转向效果和激活分布来描述每个幸存特征。我们的主要发现是,助理和角色扮演角色不是独立的替代品:角色保留了与助理相关的功能核心,同时逐步跨层区分,从操作机制开始到行为和风格特征。同时,生成的故事角色缺乏与助手相关的核心。故事和角色扮演都可以与具有沉浸式模拟模式的助手区分开来。然而,即使在默认设置下,助手有时也可以进入或慢慢进入它。