论文

微调LLM的安全测量应以能力为基础

Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

模型评测评测方法与指标

摘要

通过 微调 使基础 大语言模型 适应用户的任务或首选风格可能会导致模型的安全性受到损害。之前的工作在有限且看似随机的实验设置中研究了 微调 对模型安全性的影响。我们认为,将 微调 锚定到特定的能力目标对于避免任意的经验选择至关重要,使我们能够得出有关安全影响的有意义的结论,并在一致的基础上比较缓解方法。我们通过关注能力和安全性,对 微调 对模型行为的影响进行多维度评估。我们的结果揭示了重要的问题:(1) 微调模型可能会根据安全提示产生不连贯的生成,(2) 对于这种不连贯的输出,自动安全判断是不可靠的,(3) 关于 微调 影响的结论可能会根据安全基准和安全评估器的选择而改变。