论文

SHARD:通过自我重构实现安全且有用的对齐 蒸馏

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

模型训练监督微调与指令调优

摘要

大语言模型 经常遇到敏感的提示。他们可能会彻底拒绝,提供通用的安全样板,或者无法满足用户可以安全回答的合法信息需求。我们引入 SHARD,一种自我重构 蒸馏 方法来提高安全帮助性。它首先使用哲学准则重写敏感提示,以表达善意的意图,然后将其原始响应重新构建为安全、更有帮助的响应,最后根据其自我重构的响应对模型进行微调。在 DNA 和 LINGUASAFE 的英语子集中,SHARD 提高了对大多数模型系列的帮助性,同时保证了安全性。它还与来自更大的教师模型的 蒸馏 保持竞争力,这表明模型可以内化自己引发的安全和有益的行为。警告:本文包含可能具有攻击性或有害的内容。