论文

DT-Guard:为免推理LLM安全护栏做意图驱动的推理激活训练

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

模型训练监督微调与指令调优

摘要

部署在开放世界应用中的大语言模型需要既对复杂风险鲁棒、又足够高效以满足低延迟运行时审核的安全护栏。既有护栏面临实际权衡:轻量分类模型高效但常难应对隐蔽意图、含糊语义与边界安全决策;基于推理的护栏改善判断质量却引入额外token生成与推理延迟。我们提出DT-Guard:基于“训练时推理激活、推理时免推理”范式的内容安全护栏模型。关键思想是在训练时使用推理监督、在推理时只输出结构化安全标签。DT-Guard把安全判断形式化为渐进决策过程——意图→类别→安全——并构建带意图标签、风险类别、安全标签与结构化推理轨迹的意图驱动数据集。为进一步改善难例鲁棒性,我们提出Rollout引导的渐进难例优化(RG-PHO):用多次rollout一致性识别稳定掌握、持续失败与偏好不稳定的样本,并相应施加定向监督与偏好优化。推理时DT-Guard直接生成结构化标签而无需显式推理痕迹——保持部署效率。提示侧与响应侧安全基准上的实验显示:DT-Guard分别取得0.886与0.870的平均F1;仅用4B骨干即达双侧平均F1 0.878,超越强8B护栏基线。结果表明推理监督可有效内化为低延迟安全判别。

DT-Guard:为免推理LLM安全护栏做意图驱动的推理激活训练:论文配图
图 2:意图驱动的数据构建管道:异构安全源经过投票提炼、过滤,并经过专家验证,形成结构化 CoT 和标签监管。