论文

ODESteer:面向LLM对齐的统一ODE转向框架

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

模型推理解码与生成控制

摘要

激活转向(activation steering)或称表示工程(representation engineering),通过在推理时操纵模型内部激活,为对齐大语言模型(LLM)提供了轻量方法。然而,现有方法存在两个关键局限:(一)缺乏指导转向方向设计的统一理论框架;(二)过度依赖单步转向,无法捕捉激活分布的复杂模式。本工作提出一个基于常微分方程(ODE)的统一理论框架,用于LLM对齐中的激活转向。我们证明常规的激活加法可解释为某ODE解的一阶近似。基于这一ODE视角,确定转向方向等价于设计控制论中的障碍函数。由此框架导出的ODESteer是一种由障碍函数引导的基于ODE的转向方法,在LLM对齐上表现出经验性进步。ODESteer将障碍函数定义为正负激活间的对数密度比以确定转向方向,并用其构造ODE实现多步、自适应转向。与最先进的激活转向方法相比,ODESteer在多样LLM对齐基准上取得一致的经验改进:TruthfulQA提升5.7%,UltraFeedback提升2.5%,RealToxicityPrompts提升2.4%。本工作通过ODE统一了LLM对齐激活转向的理论基础,并以所提ODESteer方法进行实证验证,建立了有原则的新视角。

ODESteer:面向LLM对齐的统一ODE转向框架
图1:现有激活引导方法与我们提出方法的概览对比。(a–b)常规激活加法对隐藏激活施加一步线性引导T·𝒗(𝒂),其中向量场𝒗(𝒂)控制引导方向,T控制引导强度,详见第4节。(c–d)我们的方法(ODESteer)将引导表述为数值求解一个ODE,在控制理论的障碍函数引导下,得到从𝒂(0)到𝒂(T)的多步自适应更新。(e)障碍函数h(𝒂)在激活空间中定义了合意与不合意区域,将激活引向合意区域并确保其停留在该区域。(f)引导前后的生成示例表明,ODESteer产生更准确、更对齐的回复。