论文

GEMS:几何约束在 LLM 中实现多语义叠加

GEMS: Geometric Constraints Enable Multi-Semantic Superposition in LLMs

模型推理解码与生成控制

摘要

激活控制通过在推理时修改中间隐藏状态来控制模型行为,而无需重新训练。现有方法仅处理单向注入;当多个语义方向无约束地叠加时,模型就会崩溃。我们证明这种崩溃分解为两个独立作用的来源:分布偏差,其中加性扰动在各层之间以范数累积并驱动训练分布之外的激活,以及方向干扰,其中非正交语义向量在叠加时相互抑制。这两个来源定义了任何 无需训练 多向干预都必须解决的设计约束。作为这些原理的一个实例,我们提出了 GEMS,一种 无需训练 方法,它将每个源映射到相应的几何约束:范数保持加权叠加和针对分布偏差的目标注意路径注入,以及针对方向干扰的实时正交化。在 GSM8K 上,注入三个并发的非数学方向可保持 98% 的准确率(基线 92%),而无约束加法则下降至 4%;在 Wikitext-2 上,相同的注入仅导致 PPL 增加 2.2%。组件消融隔离了每个约束的因果作用,并且层级探测确认正交化信号在 FFN 路径中幸存下来并到达具有语义特异性的输出分布。定性转向效果在从 3B 到 31B 的架构之间转移。