论文
ODESteer:面向LLM对齐的统一ODE转向框架
ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment
摘要
激活转向(activation steering)或称表示工程(representation engineering),通过在推理时操纵模型内部激活,为对齐大语言模型(LLM)提供了轻量方法。然而,现有方法存在两个关键局限:(一)缺乏指导转向方向设计的统一理论框架;(二)过度依赖单步转向,无法捕捉激活分布的复杂模式。本工作提出一个基于常微分方程(ODE)的统一理论框架,用于LLM对齐中的激活转向。我们证明常规的激活加法可解释为某ODE解的一阶近似。基于这一ODE视角,确定转向方向等价于设计控制论中的障碍函数。由此框架导出的ODESteer是一种由障碍函数引导的基于ODE的转向方法,在LLM对齐上表现出经验性进步。ODESteer将障碍函数定义为正负激活间的对数密度比以确定转向方向,并用其构造ODE实现多步、自适应转向。与最先进的激活转向方法相比,ODESteer在多样LLM对齐基准上取得一致的经验改进:TruthfulQA提升5.7%,UltraFeedback提升2.5%,RealToxicityPrompts提升2.4%。本工作通过ODE统一了LLM对齐激活转向的理论基础,并以所提ODESteer方法进行实证验证,建立了有原则的新视角。
