论文

AutoLexSteer:词汇激活引导的自动对比构建

AutoLexSteer: Automatic Contrast Construction for Lexical Activation Steering

模型推理解码与生成控制

摘要

引导向量已迅速成为一种流行且有效的方法,用于以非常具体的方式引导 LLM 的输出。但由于嵌入的不透明性,构建精确的转向向量是一个困难的手动过程。我们引入了 Hangman(一种使用词义操作的新型转向向量)以及 AutoLexSteer(第一个用于构建转向向量的全自动过程)。 AutoLexSteer 采用从 WordNet 中提取的密切相关的单词族来指定要避免的转向源和所需的转向目标。引导向量非常精确,可用于在单词和单词含义(含义)的级别上进行引导,并且能够引导某些 LLM 行为,例如阿谀奉承。数据集和代码可以在https://github.com/ShuheWang1998/autolexsteer找到。