论文
MENTIS:结盟下信念会发生什么变化?测量语言模型中的多尺度潜在扭转
MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models
摘要
偏好对齐极大地改善了 大语言模型 的可观察行为,但仍不清楚内部对齐发生了什么变化。对齐的系统在越狱、即时注入和检索时损坏的情况下仍然会失败,这表明仅行为级别评估是不完整的。 后训练 应在内部计算中留下可测量的痕迹。我们问:当指令调整(IT)模型变成偏好对齐(PA)模型时,几何结构会发生什么变化,这些变化集中在哪里,以及它们如何选择性地在概念、提示和模型系列之间变化?我们引入了 MENTIS,这是一个几何优先的框架,用于测量配对检查点中对齐引起的内部重组。 MENTIS 使用基于主要分层协方差的扭转范数 (T1)、辅助谱扭转诊断 (T2) 和用于深度定位的能量-辐射-激活测量 (ERA) 来比较 IT 和 PA 模型。在 LITMUS 上的四个 7-8B 模型对中,我们的研究表明,对齐引起的变化是选择性的而不是统一的:规范概念平均比事实概念表现出更大的扭转位移;扭转与上下文熵负相关;峰值效应局限于特定于架构的中后期层。相同的模式出现在单词级、提示级和模型级分析中。这些结果表明,偏好对齐在内部计算中留下了结构化的、深度局部化的几何特征,超出了行为级别评估本身所能揭示的范围。