论文
HiRoute:大语言模型 安全对齐的分层路由提示调整
HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models
摘要
大语言模型 (LLM) 仍然容易受到有害请求和越狱攻击。基于提示调整的参数有效的安全对准方法通常依赖于单个全局提示或外部选择的提示模块。这种静态设计很难维持跨类别的安全边界,同时生成针对特定风险的建设性响应,并避免过度拒绝良性输入。为了解决这些限制,我们提出了 HiRoute,一种输入自适应的分层提示调整框架,它将与类别无关的安全控制与特定类别的响应指导分开。 HiRoute 首先根据从冻结的 LLM 中提取的表示来训练轻量级分层路由器,以联合检测有害意图并预测多标签风险评分。然后,它冻结主干模型和路由器,并使用偏好优化和交替梯度更新来学习共享的粗粒度提示和一组细粒度提示专家作为连续嵌入。在推理时,良性输入绕过安全分支,而有风险的输入则使用共享提示以及特定风险提示专家的路由器加权混合进行处理。三个指令调整模型的实验表明,HiRoute 在多个安全基准上实现了高安全率,同时保留了安全响应的帮助性、减少了过度拒绝,并保持了在通用任务上的竞争性能。