论文

ACTR:在推理大语言模型中调整思想和应对措施以实现多语言安全

ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

模型训练参数高效训练

摘要

确保跨语言推理大语言模型 (LLM) 的安全性对于其可靠部署至关重要。然而,当受到非高资源语言的越狱攻击时,即使它们的推理轨迹识别出安全风险,这些模型也可能会生成不安全的响应。为了解决这个问题,我们提出协调跨语言思维和反应(ACTR),这是一个通过加强现有安全推理的使用来改善多语言安全协调的框架。具体来说,我们首先提出思考差距得分(TGS)来比较跨语言响应生成过程中推理痕迹对注意输出的标准化贡献,并使用推理痕迹替代来衡量跨语言安全差距。接下来,使用越狱查询语料库,我们通过神经元屏蔽引起的响应表示的变化来评估神经元的重要性,并比较启用和禁用推理时获得的高重要性神经元集,以识别支持使用安全推理的安全思考神经元。最后,我们设计了神经元选择性一致性优化(NSCO),它使用冻结判断模型来奖励推理轨迹和响应的安全类别之间的一致性,同时仅更新与所选神经元相关的参数,不需要人工注释的响应或偏好数据。在两种推理模型中,ACTR 的平均攻击成功率低于 AdvBench-X 和 MultiJail 上评估的最先进方法,安全增益扩展到未见过的语言,同时保持或提高多语言知识和数学推理任务的平均性能,并限制良性请求的错误拒绝。警告:本文包含不安全内容的示例。