论文

LLM 的局部线性可通过基于模型的线性最优控制实现激活转向

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

模型推理解码与生成控制

摘要

推理时 LLM 对齐方法,特别是激活引导,通过在生成过程中直接修改激活来提供 微调 的替代方案。然而,现有方法通常依赖于非预期干预,这些干预忽略了扰动如何通过 Transformer 层传播,并且缺乏在线错误反馈,从而导致次优的开环控制。为了解决这个问题,我们凭经验证明,尽管 Transformer 模块具有非线性结构,但多个 LLM 架构和规模的分层动态可以通过局部线性模型很好地近似。利用这一特性,我们将 LLM 推理建模为线性时变动态系统,并采用经典线性二次调节器来使用分层雅克比行列式计算反馈控制器,以最小的计算开销和无需离线训练的闭环方式将激活转向所需的语义设定点。我们还推导出设定点跟踪误差的理论界限,从而对转向性能提供正式保证。使用新颖的自适应语义特征设定点信号,我们的方法可以跨模型、规模和任务产生稳健、细粒度的行为控制,包括对毒性、真实性、拒绝和任意概念的最先进的调制,超越了基线引导方法。我们的代码位于:https://github.com/trustworthyrobotics/lqr-activation-steering