论文

作为 X,做 Y:角色和任务如何在指令调整中结合 LLM

As X, Do Y: How Persona and Task Combine in Instruction-Tuned LLMs

模型评测模型行为与机制分析

摘要

形式为 X 的角色提示,Y 是否在残余流中的一个特定位置承认干净的线性分解:提示到答案的转换——最后一个提示标记与前两个生成的标记一起——在早期/中间层带中。在那里,角色和任务通过部分正交的相加方向做出贡献。在 Gemma-2-2B-IT 和 Qwen-2.5-\{1.5B, 3B\}-Instruct 上,形成纯角色效应 $Δ_X$、纯任务效应 $Δ_Y$,并用 $h_{BB} + Δ_X + Δ_Y$ 替换干净残差,在 12 单元格短网格和 48 单元长角色网格上产生小 KL 范围内的下游输出,其中保留角色特定的行为标记。从这种加性结构中得出的自然推论是,角色提示可以被压缩为单个缓存的残差向量。 \emph{我们证明它不能。}将缓存的附加预测(甚至是 Oracle 干净的残差 $h_{XY}$)注入删除角色文本的基线主机提示中,在一个站点或多个层都无法达到干净的长角色目标。人物角色条件的多标记生成通过注意力回到整个提示中的人物角色文本位置,在一个站点上没有残留再现。残余流中的局部可加性并不意味着立即可压缩。提示到答案转换的附加结构支持角色或任务贡献的可解释性和细粒度指导;整个延续中的角色条件行为取决于本地激活算术不会取代的分布式提示/KV 机制。