论文

ALIGNBEAM:通过跨词汇 logits 混合进行推理时间对齐传输

ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

模型推理解码与生成控制

摘要

域 微调 降低了 大语言模型 的安全性:经过微调的专家很容易遵守域语言中的有害提示。现有的推理时间防御将 logits 与安全锚模型混合在一起,要求两个模型共享词汇表,这将它们排除在安全性最差的跨家庭专家之外。我们提出了 ALIGNBEAM,一种 无需训练 方法,通过在每个解码步骤将锚点 logits 逐个标记地转换为目标模型的词汇表来解除此限制;然后,一个小的 LLM 法官会在 K 个候选延续中选择最安全的一个。权重不会改变,并且可以在部署时调整安全性与实用性的权衡,而无需重新训练。在跨词汇和相同词汇评估对中,ALIGNBEAM 大大提高了对抗性基准的拒绝率,同时将任务准确性和推理开销保持在实际范围内。结果表明,安全对齐可以在推理时在模型族之间转移,而无需触及任一模型的权重。