论文

D²-Monitor:基于犹豫感知路由的扩散LLM动态安全监控

$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing

模型评测安全与风险评测

摘要

尽管扩散大语言模型(D-LLM)作为自回归大语言模型(AR-LLM)的替代方案已经兴起,但针对D-LLM的安全监控在很大程度上仍未被探索。与AR-LLM不同,D-LLM通过多步去噪过程生成文本,暴露出中间隐藏表示,其中可能包含在标准单步监控设置中无法获得的安全相关信息。考虑到轻量探针适合持续在线监控,我们分析了哪些轨迹级信号最能指示此类探针何时可能失效。我们发现最具信息量的信号是安全犹豫:中间隐藏状态反复落入探针决策边界的窄小边缘范围内。D-LLM轨迹中此类犹豫步的数量能有效预测探针失败,为样本难度提供了一个代理指标。基于这一分析,我们提出D²-Monitor,一个面向D-LLM的双层安全监控器。D²-Monitor采用轻量探针作为持续在线监控器,联合估计犹豫程度并执行基础分类。当犹豫程度超过阈值时,激活一个表达能力更强但计算开销更大的探针。这种动态路由机制在测试时高效分配监控资源。在4个D-LLM上的3个数据集(WildguardMix、ToxicChat、OpenAI-Moderation)评估中,D²-Monitor以紧凑的参数规模(≤0.85M参数)取得最先进性能,并在效果与效率的权衡上相对8个基线表现最佳。

D²-Monitor:基于犹豫感知路由的扩散LLM动态安全监控:论文配图
图 1:左图:我们研究的主要问题,以及我们机制发现的直觉。中:我们的核心方法,利用犹豫严重性为重型探测和推理时间路由生成训练样本。右图:我们的主要结果显示了 WildGuardMix 的有效性与效率权衡。每个点代表一种方法,x 轴显示测试时使用的预期参数数量,y 轴显示 F1 分数。 D2\mathit{D^{2}}-监视器在使用比大多数基线更少的参数的同时实现了最佳 F1。