论文
FineSteer:大语言模型 中细粒度推理时间引导的统一框架
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
摘要
大语言模型 (LLM) 经常表现出不良行为,例如违反安全规定和产生幻觉。尽管推理时引导提供了一种在不更新参数的情况下调整模型行为的经济高效的方法,但现有方法由于其严格的、一刀切的设计和有限的适应性,往往无法同时有效、保留效用和训练高效。在这项工作中,我们提出了 FineSteer,一种新颖的引导框架,它将推理时间引导分解为两个互补的阶段:条件引导和细粒度向量合成,从而允许对何时以及如何引导内部表示进行细粒度控制。在第一阶段,我们引入了子空间引导条件转向(SCS)机制,该机制通过避免不必要的转向来保留模型效用。在第二阶段,我们提出了一种混合转向专家(MoSE)机制,该机制捕获所需转向行为的多模态性质并生成特定于查询的转向向量以提高效率。通过 SCS 和 MoSE 中的定制设计,FineSteer 在一般查询上保持稳健的性能,同时以训练高效的方式自适应优化目标输入的转向向量。关于安全性和真实性基准的大量实验表明,FineSteer 在整体性能方面优于最先进的方法,以最小的效用损失实现更强的转向性能。代码可在 https://github.com/YukinoAsuna/FineSteer 获取