论文

大语言模型 中二项式排序偏好的行为和表征证据

Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 可以很容易地重现传统表达式,但它们对梯度频率分布进行建模的能力仍未得到充分开发。我们使用语言二项式(例如“男人”和“女人”)对此进行研究,其中两个词的排列在语法上都是有效的,但在惯例方面表现出明显的跨语言变化。我们将二项式排序形式化为分布对齐问题,并构建了一个包含 8 种语言的 600 个二项式对的多语言数据集。通过分类和分布指标,我们测量并比较了语料库派生的偏好与模型诱导的 6 个开放权重 LLM 的排序概率。虽然模型通常在行为上恢复占主导地位的语料库偏好顺序,特别是对于强传统化的对,但它们与确切的语料库偏好分布的一致性较差。这表明明显的方向顺序夸大了 LLM 如何忠实地捕捉语言使用的统计细微差别。稀疏探测验证了偏好强度的概念在中后期层中部分编码,并且沿着探测导出的方向进行转向改变了模型引起的排序分布,证明了 LLM 的统计行为偏好可以通过内部表示来机械地测量和操纵。