论文

通过积分策略梯度解释与控制LLM推理

Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient

模型评测模型行为与机制分析

摘要

大语言模型(LLM)在解决复杂现实问题中展现出强大的推理能力,但驱动这些复杂推理行为的内部机制仍不透明。现有针对推理的可解释性方法,要么识别与特定文本模式相关的组件(如神经元),要么依赖人工标注的对比对来推导控制向量。因此,现有方法难以精确定位复杂推理机制,也难以捕捉从模型内部运作到推理输出的序贯影响。本文基于面向结果与感知序贯影响的原则,专注于识别对推理行为具有序贯贡献的组件,其中结果由长程效应累积而成。我们提出积分策略梯度(Integrated Policy Gradient,IPG),一个将推理行为归因到模型内部组件的新框架,它把推理后准确率等基于复合结果的信号沿模型推理轨迹反向传播。实证评估表明,我们的方法实现了更精确的定位,并能在多种推理模型上可靠地调制推理行为(如推理能力、推理强度)。

通过积分策略梯度解释与控制LLM推理
图1:LLM 推理可解释性方法的范式及在推理数据集上的比较结果。(a)三种范式的示意:(i)文本模式方法,将高激活与特殊 token(例如“Wait”)相关联;(ii)控制向量方法,依赖人工构造的对比输入对;(iii)我们提出的 Integrated Policy Gradient 方法。t 为推理时间步。(b)干预推理组件:被选中的组件按因子 \gamma 进行缩放(见第 3.3 节)。(c)同时以抑制和增强两种方式控制推理行为。