论文

语境关系的几何:语言模型按提及顺序处理事实

The Geometry of Contextual Relations: Language Models Address Facts by Order of Mention

模型评测模型行为与机制分析

摘要

人类推理取决于命题中对象之间的关系。 关系如何组织上下文内容的语言表征? 我们为大语言模型提供了其上下文中的事实列表(例如,Alice eats an apple. Bob eats a pear.),并测量当问题从爱丽丝吃什么切换到鲍勃吃什么时其隐藏状态如何变化。对许多列表进行平均后,这种变化就是一个转向向量,我们称之为 ordinal vector。它通过 order of mention 指向一个事实,即事实在上下文中陈述的顺序。我们发现大语言模型通过问题的提及顺序而不是问题所包含的名称来代表问题所询问的事实。我们将其表述为 ordinal addressing hypothesis:每个提及顺序在模型状态中都有一个 fact address,由所有上下文共享,并且问题将状态移动到它所询问的事实的事实地址,而上下文则提供该事实所说的内容。在 Qwen、Gemma 和 Llama 中,事实地址为 (1) ordered by mention:查询状态按事实顺序组织,而不是按名称顺序组织,即使一个事实有多个主题; (2) steerable:添加到有关新列表的第一个事实的问题中,序数向量使模型回答该列表的第二个事实; (3)low-rank:它们跨越一个低秩子空间,其中第一个提到的事实是最容易到达的,与人类的记忆惊人地相似; (4) emergent:它们在中后期层共享,保存从 1.5B 到 32B 的参数,并在预训练早期形成。语言模型通过提到的地方达到既定事实,加深了我们对 LLM 推理的理解。