论文

提取预训练LLM中的算法:以隐马尔可夫模型为例

Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models

模型评测模型行为与机制分析

摘要

大语言模型(LLM)展现出一种惊人能力:通过上下文学习(ICL)预测来自隐马尔可夫模型(HMM)的下一个观测,但这一能力背后的算法仍未确定:已有工作提出过若干候选而未达成共识,且没有任何一个建立在模型内部激活的基础上。我们用一个三阶段流水线弥合这一空白。首先,我们将LLM行为与一组候选算法进行经验比较,把范围缩小到三类——尽管没有任何单一类能解释LLM在所有HMM设置和序列长度下的行为。其次,我们推导这三类之间的理论联系,并展示每一类如何能由Transformer在上下文中实现,且在一个小型训练过的Transformer中验证了该构造。第三,回到预训练LLM,我们提出主激活探针(Principal Activations Probe,PAP),一种逐层探测与干预方法,可分离模型激活中的算法信号。PAP揭示了低维线性表示,它们因果地驱动模型预测并跟踪经验ICL性能。PAP进一步揭示这些表示如何随底层HMM机制的属性而变化;不同的计算阶段定位于不同层。总而言之,我们的结果将预训练LLM的上下文行为与其底层内部机制联系起来,推进了对LLM如何在HMM上执行ICL的理解。

提取预训练LLM中的算法:以隐马尔可夫模型为例:论文配图
图 1:我们的研究概述。