LoRA 适配器的光谱几何编码训练目标并预测有害的合规性
Spectral Geometry of LoRA Adapters Encodes Training Objective and Predicts Harmful Compliance
摘要
我们研究 LoRA 权重增量的低秩谱摘要是否可以识别哪个 微调 目标应用于语言模型,以及该几何信号是否可以预测下游行为危害。在 \texttt{Llama-3.2-3B-Instruct} 上的预注册实验中,我们制造了 4 个类别的 38 个 LoRA 适配器:健康的 SFT 基线、反向无害偏好的 DPO、反向有用偏好的 DPO 和激活引导衍生的适配器,并提取每层频谱特征(范数、稳定秩、奇异值熵、有效秩和与健康质心的奇异向量余弦对齐)。在单一训练方法 (DPO) 中,逻辑回归分类器在二元漂移检测、所有六对客观比较和近乎完美的序数严重性排名 ($ρ\geq 0.956$) 上实现了 AUC~1.00。对扁平权重增量的主成分分析表明,训练目标是 PC1(目标分离的 AUC~1.00),与 PC2 上的训练持续时间正交。查询投影权重检测是否发生了漂移;价值预测权重确定哪个目标。跨方法泛化完全失败:经过 DPO 训练的分类器为每个转向适配器分配比每个 DPO 适配器更低的漂移分数 (AUC~0.00)。在行为评估阶段,DPO 反向无害适配器在 HEx-PHI 提示上显示出较高的有害依从性(平均 ASR 0.266 与健康 0.112,$Δ= +0.154$),并具有近乎完美的剂量反应($ρ= 0.986$)。 24 个非导向适配器的几何与行为等级相关性为 $ρ= 0.72$。这些结果表明,在受控制造体系内,LoRA 权重空间几何结构具有客观身份、强度排序以及与有害合规性的粗略联系,并且跨方法监控需要按方法进行校准。