论文

LLM中的推理时因果探测

Inference Time Causal Probing in LLMs

模型推理解码与生成控制

摘要

因果探索方法旨在测试和控制内部表征如何影响生成模型的行为。在因果探索中,干预会修改隐藏状态,以便属性呈现不同的值。大多数现有方法通过训练辅助探针分类器来定义此类干预措施,该分类器将方法与特定任务或模型联系起来,并存在与模型的预测几何不一致的风险。我们提出了隐藏状态驱动裕度干预(HDMI),这是一种无探针、基于梯度的技术,可使用模型的本机输出直接引导隐藏状态。 HDMI 应用边缘目标,增加目标连续的概率,同时降低源的概率,而不依赖于探测分类器。我们进一步引入了一种用于文本编辑的前瞻变体(LA-HDMI),它通过 softmax 嵌入进行反向传播,修改当前的隐藏状态,以便在保持流畅性的同时,在下一代词元中用户指定词元的可能性增加。为了评估干预措施,我们测量完整性(目标属性是否按预期变化)和选择性(是否保留不相关的属性),并将其调和平均值报告为可靠性的总体度量。在 LGD 协议库和 CausalGym 基准测试中,在 Meta-Llama-3-8B-Instruct 和 Pythia-70M 上,HDMI 始终实现了比先前方法更高的可靠性。

LLM中的推理时因果探测:论文配图
图2:分任务的可靠性:数值在LLaMA与Pythia-70M模型上平均。