论文
K/V 缓存干预将表示对齐与仅解码器语言模型中的角色表达分离
K/V-Cache Interventions Dissociate Representation Alignment from Persona Expression in Decoder-Only Language Models
摘要
我们研究 K/V 缓存干预——将目标条件 K/V 轨迹移植到源角色生成中——作为纯解码器语言模型中角色控制的结构化表面。在应用于 Llama-3.1-8B 的固定源到目标角色对的 13 种干预配置中,我们报告了表征级别对齐和行为表达之间的两个一致的分离,以及位置扰动下的常见失败。首先,所有层带 K/V 替换(早期、中期、晚期)都实现了强大的局部 V 空间对齐(V 间隙 0.91、0.89、0.84),但只有中间层替换(第 9-20 层)将大量目标标记表达与保留的词汇多样性结合起来。其次,全层和中间层替换导致可比的对齐(V 间隙 0.94 与 0.89),但产生不同的词汇多样性概况(TTR 0.65 与 0.77)。第三,位置扰动(滞后和洗牌)应用不同的操作,但统一抑制目标人物的表达——这是一种常见的行为失败,而不是严格的分离。因此,仅表征级别的相似性度量不足以预测我们研究的体系中的下游角色表达; K/V 缓存作为一个可控但结构受限的干预面出现。由于移植的轨迹带有目标自己生成的词元历史,因此我们将干预描述为轨迹级移植,而不是孤立的角色表示注入;相同词元序列控制,在源与目标条件下解码相同的词元序列,再现 L28 表征转变的符号和层定位,表明该转变不仅仅由导入的词元历史来解释。这些发现描述了高信号环境中表征与行为分离的特征,而不是在模型或角色对之间建立普遍性。