论文
D²-Monitor:基于犹豫感知路由的扩散LLM动态安全监控
$D^2$-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing
摘要
尽管扩散大语言模型(D-LLM)作为自回归大语言模型(AR-LLM)的替代方案已经兴起,但针对D-LLM的安全监控在很大程度上仍未被探索。与AR-LLM不同,D-LLM通过多步去噪过程生成文本,暴露出中间隐藏表示,其中可能包含在标准单步监控设置中无法获得的安全相关信息。考虑到轻量探针适合持续在线监控,我们分析了哪些轨迹级信号最能指示此类探针何时可能失效。我们发现最具信息量的信号是安全犹豫:中间隐藏状态反复落入探针决策边界的窄小边缘范围内。D-LLM轨迹中此类犹豫步的数量能有效预测探针失败,为样本难度提供了一个代理指标。基于这一分析,我们提出D²-Monitor,一个面向D-LLM的双层安全监控器。D²-Monitor采用轻量探针作为持续在线监控器,联合估计犹豫程度并执行基础分类。当犹豫程度超过阈值时,激活一个表达能力更强但计算开销更大的探针。这种动态路由机制在测试时高效分配监控资源。在4个D-LLM上的3个数据集(WildguardMix、ToxicChat、OpenAI-Moderation)评估中,D²-Monitor以紧凑的参数规模(≤0.85M参数)取得最先进性能,并在效果与效率的权衡上相对8个基线表现最佳。
