论文
二到探戈:安全 LLM 微调 的耦合任务参考选择
Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning
摘要
下游数据上的 微调 安全对齐 大语言模型 (LLM) 提高了适应性,但可能会削弱习得的安全行为。现有方法使用固定安全示例、全局约束或单方面任务过滤。我们的诊断显示任务更新暴露了不同的安全约束,促使联合选择相关参考和兼容的任务示例。我们提出了 DualSelect,一个用于任务和参考选择的耦合框架,它在过滤与诱导的参考方向兼容的整个任务样本之前刷新任务条件安全参考。在极小极大视图下,DualSelect 通过熵正则化评分代理、惰性参考刷新和梯度校正,选择具有高保存损失和任务冲突的安全参考以及兼容的任务样本。在 1B-8B LLM 上,DualSelect 在不丢失任务实用性的情况下保持安全;使用 REDORCA 判断,它提高了安全平均数。比最强基线至少高出 5.10 个点,并且在安全平均值中保持最高水平。以适度的开销跨越法官。这种观点延伸到以保留为重点的持续学习。