论文

当余弦相似度无法反映对话模型中的线性可访问结构时

When Cosine Similarity Fails to Reflect Linearly Accessible Structure in Dialogue Models

模型评测模型行为与机制分析

摘要

余弦相似度被广泛用于分析Transformer表示,隐含地假设相似度反映了任务相关的结构。我们研究这种假设在对话条件大型语言模型中何时失效。在三个 7-8B 聊天调整模型中,环境余弦相似度大大低估了相同隐藏状态上的线性可解码角色结构;从数值上看,在 30 类任务中,线性探针 AUC 在 0.73-0.97 范围内,而余弦 kNN 在 0.56-0.77 范围内。低维监督子空间可以弥补大部分这种差距,而匹配秩的 PCA 子空间则不能,并且在某些情况下会降低性能。这种不匹配是与制度相关的:它在单句情感分类(SST-5)中不存在,并且匹配基数控制排除了属性基数作为混杂因素。这种差距不会在对话轮次中系统性地增加,并且与任务相关的子空间随着时间的推移保持稳定。然而,三个模型中的两个违反了预先注册的子空间内可分离性不变性准则(|Delta AUC| <= 0.03),并且一个模型违反了预先注册的转弯不变性准则(|Delta L| <= 0.05)。这些结果表明,余弦相似性可能无法反映对话表示中的任务对齐结构,即使该结构是线性可访问的。