论文

Read-Best 并非 Steer-Best:探索——全模态大语言模型中的引导层分离

Read-Best Is Not Steer-Best: A Probing--Steering Layer Dissociation in Omni-Modal Large Language Models

模型评测模型行为与机制分析

摘要

全模态大语言模型将文本、音频和图像信号集成到共享的残差流中,其中情感等概念可以通过激活控制进行线性解码和因果修改。一个常见但很少测试的假设是,探测精度最高的层也是转向的最佳层,因此注入层通常根据探测性能来选择。我们在三个独立开发的全模态模型中对该假设进行了首次因果检验,结果发现它失败了。阅读和干预依赖于不同的层次,这种现象我们称之为探测引导层分离。使用情感作为受控测试平台,我们测量文本、音频和图像输入的分层可读性和可操纵性。探测最佳层在不同架构之间差异很大,而有效控制层始终落在归一化深度的狭窄中后期范围内。成对的随机方向控制显示出大约 26 倍的因果差距,排除了随机扰动和方向质量作为解释。logit透镜分析揭示了一个分阶段的前向过程:因果处理、探测饱和度和词汇承诺,并激发了一个双因素解释,其中转向有效性取决于表征可读性和下游可塑性。这些结果表明,探测准确性对于选择干预层来说是一个很差的启发式方法,并提出了跨架构的中后期选择标准。我们还确定了一个由效价和唤醒度组织的跨模式情感子空间,其中快乐充当跨模型的稳定锚。代码和数据:此 https URL。