论文

GEOSTEER:大语言模型 中激活转向的测地线优化

GEOSTEER: Geodesic Optimization for Activation Steering in Large Language Models

模型推理解码与生成控制

摘要

激活控制提供了一种轻量级的方法来通过在推理时修改其隐藏激活来控制 大语言模型 (LLM)。在这些方法中,规范保持引导旨在在不改变激活规范的情况下改变模型行为,从而降低表示崩溃和退化的风险。然而,现有的范数保持方法受到预定义的转向轨迹及其对一步更新的依赖的限制,这可能无法捕获激活分布的复杂结构。我们提出了 GeoSteer,一种基于优化的方法,用于保持规范的激活控制。 GeoSteer 将转向表述为黎曼优化问题,并通过表示流形上的一系列小测地线步骤更新激活。为了避免固定的转向方向,GeoSteer 学习一个非线性激活空间目标,该目标区分所需激活和不需要的激活,并使用此函数自适应地引导每个转向步骤。这种多步公式可产生更平滑、更稳定和更一致的转向行为,同时保留激活范数。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准测试中,GeoSteer 持续改进最先进的激活转向基线。这些结果表明,通过用自适应、几何感知优化替换预定义的一步编辑,可以使保持规范的转向更加有效。