论文

LLM 中代词保真度的机制理解

A Mechanistic Understanding of Pronoun Fidelity in LLMs

模型评测模型行为与机制分析

摘要

忠实而稳健的代词使用对于公平和连贯的世代非常重要,但当多个指称使用不同的代词时,大语言模型 很大程度上会失败。为了研究推理、重复和偏见在这项任务中的相互作用,之前的工作完全依赖于行为方法,这可能无法反映模型的内部运作。因此,我们提供了关于代词保真度的机制、模型内部视角,测试三种机制——组实体绑定 (G)、新近度偏差 (R) 和刻板印象偏差 (S)——是否在多个 SOTA 语言模型中因果实现。使用无边界分布式对齐搜索,我们发现所有三个共存为分布在网络深度上的因果子空间。没有任何一种机制可以完全解释模型行为,但三种机制的组合始终占 91-99.5%。注意力头分析进一步揭示了两种相互竞争的复制路线;组绑定和刻板印象共享检索绑定的占用代词单元的本地化概念级路线,而新近度使用重复表面形式的分布式 词元级 路线。总之,代词保真度源于同时活跃的因果子空间之间的竞争。