论文

几何计算:意味着身份是计算的,而不是在嵌入中传送的

Computation Over Geometry: Meaning Identity Is Computed, Not Shipped in the Embeddings

模型评测模型行为与机制分析

摘要

在检索和 RAG 中,意义同一性(两个句子在措辞改变后是否说同一件事)被视为关于独立编码的句子向量的几何事实。我们证明,对于冻结的现成编码器和语言模型来说,它不是:当两个句子共享一个前向传递时计算同一性,并且不是这些系统附带的嵌入几何的属性。在重叠匹配的 PAWS-X 上,专用编码器(BGE、E5、GTE、MiniLM、E5-Mistral-7B)达到英语确认 AUC 仅 0.55-0.65(密集峰值 0.70)。 Llama 3、Mistral 和 Qwen 独立编码的最后一个词元状态也没有做得更好;两个向量的后期融合几乎是偶然的。联合前向传递的相同探针从 1.5B 到 32B 达到 0.90-0.96,在伙伴洗牌下崩溃,处于中等深度,在 3B 处饱和接近 0.94,并且在 GPT-2 XL (0.76) 中显得更弱。这一差距超出了其他因果 LM、双向编码器(DeBERTa、RoBERTa)和编码器-解码器(Flan-T5、T5、BART)上的 Llama 式模型。冻结独立编码上的固定或线性读取器永远不会解锁身份;非线性对读取器仅在完整的 49k 对 PAWS 序列分割 (0.68-0.87) 上恢复部分数据。现成的重新排名器分裂:BGE-reranker-large 达到 0.94,而 MS-MARCO 和 Jina 保持在 0.55-0.64。独立训练的家庭计算相同的关系,并且 1.5B 联合阅读器可以从未标记的教师分数中提取它,而教师自己的独立向量的线性函数则不能。双编码器可以进行微调以适应 PAWS (0.87-0.93),但传输和 STS-B 会受到影响。余弦比较文字邻域;身份是一个廉价的计算运算符,而不是任一句子向量的属性。