论文
安全重建:通过掩模扩散的生成模型构建强大的安全护栏
Safety Reconstructed: Generative Modeling via Masked Diffusion Builds Strong Safety Guardrails
摘要
防护模型是语言模型和有害输出之间的最后一道防线,但它们的训练目标却出人意料地狭窄。现有的警卫学习从对话上下文中预测单个判决标记,将监督集中在单个目标上。其后果是结构性的:模型锁定快捷特征,过于自信,并且对安全证据在序列中出现的位置而不是其在整个上下文中的作用保持敏感。我们提出了一个不同的框架。我们的 LLaDA-Guard 不是根据文本预测标签,而是询问哪个标签能更好地解释文本:对每个标签假设下的提示或响应进行评分,并根据它们的差异进行分类。这将监管转移到监管区域中的每个词元,迫使模型考虑完整内容而不是最具歧视性的片段。我们用掩蔽扩散语言模型实例化了这个想法,使用 LoRA 通过类条件重建目标对 LLaDA-8B-Instruct 进行微调,并且不需要对基本模型之外的架构进行任何更改。 LLaDA-Guard 在七个坚持的安全基准中在更强的骨干上训练的歧视性基线平均排名领先,同时表现出明显更好的置信度校准(ECE 0.0875 vs. Qwen3Guard 0.1384),减少对具有不安全提示的良性提示的过度防御,以及在调节响应时减少提示泄漏。其生成性质进一步使词元级风险本地化成为一种自然的副产品,产生了一个将不安全提示重写为安全等价物的管道,无需额外的训练,并实现 60.7% 的平均安全转换率。