论文
谁获得词元,它携带什么?大语言模型中的不平等名称支持和概念访问
Who Gets a Token, and What Does It Carry? Unequal Name Support and Concept Access in Large Language Models
摘要
名字是个人标识符,但它们也具有社会意义,被广泛用于评估语言模型如何对待不同的人。此类评估通常假设匹配的名称是可比较的模型输入。我们证明这种假设在词法接口上经常失败:匹配的名称不一定是匹配的输入。一些名称接受直接的单词元访问,而其他名称则由多个子词组合而成,从而创建了不平等的名称表面支持。在近 50 万个名字和 12 个与 LLM 相关的标记器中,直接词汇访问具有高度选择性、依赖于模型,并且在与种族和性别相关的名称元数据中不均匀。我们引入了 NameTrace,这是一个模型原生的、细粒度的、前行为框架,用于测量不平等的名称表面支持是否仍然是词汇属性或在任务相关的内部表示中变得可见。 NameTrace 根据模型自身在任务特定形容词轴上的概率以及连续的任务对齐权重来衡量概念的可访问性。在同一种族/族裔(与性别相关的阶层)中匹配的原子名称和短片段名称上,支持预测了奖学金、招聘、临床评估和贷款中概念可及性的系统差异。这些差异在所有八个匹配的阶层中都存在,延伸到模型系列,并转移到看不见的名称。隐藏状态干预进一步表明,测量的任务方向具有下游杠杆作用,改变了后来的受限选择。因此,不平等的词汇支持在输入时按人口统计学结构,并且在任务相关模型计算中仍然可见。 NameTrace 使词汇可比性变得可测量,支持更广泛的原则:行为可比性始于词汇可比性。