论文

H-Probes:从语言模型的潜在表示中提取层次结构

H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models

模型评测模型行为与机制分析

摘要

表示和导航层次结构是推理的基本原语。 大语言模型 已表现出对各种需要分层推理的任务的熟练程度,但对模型如何以几何方式表示此类思维所需的潜在结构的分析有限。为此,我们开发了 H 探针,这是一组线性探针,可从潜在表示中提取层次结构,特别是深度和成对距离。在合成树遍历任务中,H 探针稳健地找到包含完成任务所需的层次结构的子空间;此外,在综合消融实验中,我们表明这些包含层次结构的子空间是低维的,对于高任务性能具有因果关系,并且可以在域内和域外进行推广。此外,我们在现实世界的分层上下文中发现了类似但较弱的分层结构,例如数学推理痕迹。这些结果表明,模型不仅在语法和概念级别上表示层次结构,而且在更深层次的抽象级别上表示层次结构 - 包括推理过程本身。