论文
不欺骗的利用:黑暗三合一特征引导揭示了语言模型中可分离的反社会回路
Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
摘要
我们使用稀疏自动编码器 (SAE) 特征控制来放大 Llama-3.3-70B-Instruct 中的黑暗三人格特征(马基雅维利主义、自恋和精神病),并评估五种心理工具所产生的行为变化。引导模型在新的行为场景(d=10.62)上变得更加剥削、更具攻击性和冷酷无情,而其认知同理心保持不变,再现了人类黑暗三合会群体的同理心分离特征。重要的是,战略欺骗在所有功能中完全不受影响,这表明剥削和欺骗可能通过 大语言模型 中可分离的计算路径进行操作。个体特征分析揭示了非冗余编码,每个特征通过可分离的计算路径驱动不同的反社会机制。我们还表明,特征发现方法本身调节干预深度:对比发现的特征会改变自我报告和行为,而语义搜索的特征仅改变自我报告(行为方法之间的 d=12.65)。这些发现表明,至少一个 大语言模型 中的反社会倾向由可分离的成分组成,而不是一个统一的结构,这对如何检测、测量和控制此类倾向具有影响。