论文

LLM 行为控制的 无需训练 任务向量

Training-Free Task Vectors for LLM Behavioral Control

模型训练模型编辑与遗忘

摘要

任务向量通过识别权重空间中语义上有意义的方向来实现 后训练 模型编辑,通常计算为微调模型与其预训练初始化之间的差异。然而,这种对 微调 的依赖使得发现此类方向的成本高昂,并限制了 后训练 模型编辑的实用性。为了解决这个限制,我们引入了 无需训练 任务向量(TFTV),这是一种无需 微调 即可计算类似任务向量方向的新颖方法。我们的方法仅使用前向传递统计将激活引导向量映射到排名一权重空间编辑,同时满足直接支持通过加法学习、通过减法遗忘以及多个编辑的组合的算术属性。根据经验,我们在 大语言模型 行为控制任务上评估 TFTV,并表明它们始终如一地放大、抑制和组合目标行为,同时保留常识和解决问题的技能。我们还根据其他编辑和引导基线验证了我们的方法,通过实验证明 TFTV 通过更好或有竞争力的效用保留实现了更强的性状控制。我们希望我们的工作为社区在 后训练 模型编辑和更广泛的 无需训练 模型控制方面开辟新的方向。代码可在项目网站上找到:tftv-LLM.github.io。