论文

同理心是可操纵的,但是多轴的:大语言模型中的机制几何和角色效应

Empathy Is Steerable but Multi-Axial: Mechanism Geometry and Persona Effects in LLMs

模型评测模型行为与机制分析

摘要

激活转向已被用来控制诚实、拒绝和阿谀奉承等特征,但支持性同理心是沿着多个维度进行评估的,这些维度不需要与独立可控的激活方向相对应。使用 EPITOME 框架(将支持性同理心分解为情绪反应、解释和探索),我们研究了三个经过指令调整的大语言模型,并询问从这些标签派生的候选方向是否会产生可区分的干预效果或共享结构,以及角色提示如何与这些方向相互作用。我们发现对比激活添加产生了稳定的中间层干预,该干预持续改变模型之间的 EPITOME 代理分数,使移情分析超越响应级别评分。然而,恢复的方向只是部分可分离的:转向一个方向会导致偏离目标的转变,而手工制作的提示会改变同理心特征,而不是隔离单一维度。角色促使 EPITOME 分数发生显着变化,但配对的激活转移分解表明,恢复的子空间仅捕获第 15 层角色引起的平方激活转移幅度的约 3%。在这个基于 EPITOME 的定义下,表达的同理心是可操纵的,但是多轴的,控制角色条件共情需要超越个体机制方向的目标结构。