从方向到幅度:多模态指令调优如何重组 Transformer 隐藏状态中身份指定提示的几何编码
From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States
摘要
我们研究身份指定系统提示是否在跨越四个 后训练 体系的四个开放权重 Transformer 语言模型的隐藏状态轨迹中产生统计上可区分的几何指纹:无训练(Gemma-4-E4B 基础)、多模态 RLHF(Gemma-4-E4B-it)、RL 蒸馏 (DeepSeek-R1-Distill-Qwen-7B) 和 SFT (Qwen2.5-7B-Instruct)。通过五个几何度量(主要是 k-NN 轨迹图上 Olivier-Ricci 曲率的边缘分布之间的 1-Wasserstein 距离)比较三个提示条件(身份指定轴提示、长度匹配的通用辅助提示和 26 个标记的普通基线)。声明基于具有多个几何控制的轨迹级排列测试(教师强制内容控制、时间链与 k-NN 拓扑、ABT 投影 k-NN、角度与欧几里德图构造、边界统计上的 B=5000 排列)。核心发现是跨指令调整边界的身份编码的定性重组:在基本模型中,指纹是方向编码的(角度 k-NN 下的分离度 0.034,p=0.002);在多模态指令调整模型中,它迁移到幅度(角度分离崩溃到 p=0.439,而欧几里德在 p=0.042 时仍然存在,并且第一个生成状态的平均范数反转其长度排序,对于恒等提示来说是最低的)。这种从方向到幅度的重组特定于多模式指令调整机制,RL 蒸馏 和 SFT 中不存在。教师强制控制将约 30% 的自由运行余弦信号归因于提示驱动效果。我们将 W_1 定位在 k-NN 轨迹图上的边缘 Olivier-Ricci 分布上,作为独立兴趣的方法论贡献。