论文

语言模型的微创引导

Minimally Invasive Steering of Language Models

模型推理解码与生成控制

摘要

Pre-logit 转向通过将向量添加到其最终隐藏状态,使冻结的语言模型适应测试时间奖励。不规则的奖励优化会极大地改变产出分布并降低生成质量。我们提出微创转向向量优化(MISVO),它使用诱导词元分布的局部 KL 几何来惩罚干预。由此产生的费舍尔二次方程测量分布敏感性,并允许通过矩阵向量乘积与冻结语言模型头计算的分析梯度。我们将序列级 KL 梯度精确分解为解析费希尔项和后缀评分函数项。对于固定的生成范围,我们表明后缀项是转向幅度的二阶,并且三个 Fisher 代理与一阶的完整 KL 梯度一致。 MISVO 使用冻结参考代理来优化特定位置的干预措施,而无需更新模型参数。在具有大约 1B--14B 参数的模型上的偏好和代码生成任务中,MISVO 在七个模型任务设置中的六个中实现了最高平均奖励,多样性和一致性得分接近 Best-of-N。