论文
通过积分策略梯度解释与控制LLM推理
Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient
摘要
大语言模型(LLM)在解决复杂现实问题中展现出强大的推理能力,但驱动这些复杂推理行为的内部机制仍不透明。现有针对推理的可解释性方法,要么识别与特定文本模式相关的组件(如神经元),要么依赖人工标注的对比对来推导控制向量。因此,现有方法难以精确定位复杂推理机制,也难以捕捉从模型内部运作到推理输出的序贯影响。本文基于面向结果与感知序贯影响的原则,专注于识别对推理行为具有序贯贡献的组件,其中结果由长程效应累积而成。我们提出积分策略梯度(Integrated Policy Gradient,IPG),一个将推理行为归因到模型内部组件的新框架,它把推理后准确率等基于复合结果的信号沿模型推理轨迹反向传播。实证评估表明,我们的方法实现了更精确的定位,并能在多种推理模型上可靠地调制推理行为(如推理能力、推理强度)。
