论文
创意碰撞:《大语言模型》中的导演角色引导与竞争
Creative Collision: Directorial Persona Steering and Competition in Large Language Models
摘要
激活引导已成为在推理时塑造 大语言模型 行为的强大工具,但大多数先前的工作将 \emph{single} 语义方向注入到残余流中。我们研究了更丰富的设置,其中两个语义相反的转向向量叠加——我们称之为 \textbf{Creative Collision} 的机制。具体来说,我们通过对策划的剧本衍生语料库的均值差异激活对比,为史蒂文·斯皮尔伯格(乐观、救赎的道德价)和马丁·斯科塞斯(黑暗、道德模糊)构建导演角色向量,然后使用标量混合参数 $α\in [0,1]$ 和转向系数 $λ$ 在它们之间进行插值。跨越五个评估轴——道德效价、世代连贯性、表面风格、方向优势和矢量几何——出现了三个主要发现:(i)~斯皮尔伯格的代表性签名表现出强大的\emph{方向优势},抑制了斯科塞斯几乎在整个插值范围内的道德影响; (ii)~相对于高 $λ$ 下的纯单导向器转向,中间碰撞点矛盾地 \emph{improv} 生成相干性; (iii)~两个角色都最大程度地定位于 40 层解码器 Transformer 的~28 层,揭示了共享的 \emph{道德基调基底}。这些结果阐明了 Transformer 残余流中竞争语义方向的几何形状,并对可控创意生成和价值一致的叙事合成具有直接影响。