论文

通过 logits 偏差对语言模型进行极其简单的黑盒调整

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

模型推理解码与生成控制

摘要

许多组织的目标是调整语言模型以供内部使用,以提高特定领域任务的性能并解决敏感数据的隐私问题。然而,这种适应仍然很重要:它通常需要在操作上具有挑战性的开源模型 微调 或临时提示优化。我们研究了基于简单 API 级控制的最小替代方案:允许用户使用用户定义的向量来偏置模型的 logits。我们开发了一种黑盒方法,用于学习单个上下文无关的 logits 偏差向量,在每个解码步骤中添加,无需修改模型权重或需要梯度。从 KL 正则化强化学习 (RL) 目标开始,我们描述了这样一个固定的 logits 偏差向量何时可以逼近最优的前缀相关校正,并从采样轨迹、奖励和词元概率导出封闭形式的逆倾向估计器。根据经验,这种简单的解码时间干预在数学和推理基准上比基本模型有所改进,同时使用比传统 微调 少得多的可训练参数。我们的结果表明,学习到的 logits 偏差是一种轻量级机制,用于在最低访问要求下调整语言模型。