论文
SafeTune:一个统一的忠实库,用于审核和修复微调大语言模型中的安全偏差
SafeTune: A Unified Faithful Library for Auditing and Repairing Safety Drift in Fine-Tuned LLMs
摘要
用于解决微调大型语言模型 (LLM) 中的安全漂移的方法分散在不兼容的实现、生命周期阶段和评估协议中,这使得它们难以采用和比较。我们引入了 SafeTune,这是一个源可用的库,它统一了四种干预范例:事后体重恢复、安全约束微调、基于梯度的遗忘和推理时间引导,以及共享的可解释性、评估和部署实用程序。 SafeTune 提供一致的配置驱动工作流程,同时保留每个范例所需的不同输入和干预点。其模块化注册表支持新方法、基准、判断、模型和微调领域,而无需重新设计周围的管道。我们通过受控比较以及财务和医疗部署案例研究来展示 SafeTune,展示它如何表征安全漂移,评估对常见拒绝行为和能力评估的可行干预措施,并支持校准或分层缓解措施。