论文

AERIC:针对隐式有害对话的预期隐藏状态监控

AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

AI 基础设施AI安全与内容治理基础设施

摘要

当前的语言模型带来了两个安全挑战:必须尽早发现风险以避免暴露有害的延续,并且危害性本身可能是隐含的,而不是通过明显的有毒文本来表示。现有的响应级防护在判断完整文本方面很强大,而本机流式防护更接近词元时间,但这两种设置都没有确定轻量级监视器是否可以预测来自生成器自身内部轨迹的隐式有害漂移。我们研究预期的同通道监控,其中安全监控器可以读取普通解码期间产生的隐藏状态,但可能不会调用通过基本模型的额外前向传递。我们引入了 AERIC,一种用于隐式有害对话的面向转移的隐藏状态方法,它结合了短期危险预测、支持敏感抑制和同一通道指数移动平均决策规则下的提示条件残差评分。默认线性监视器仅包含 387 个可训练头部参数。与平衡基准上的 Qwen3GuardStream-4B 相比,AERIC 在 DiaSafety 上将 AUROC 从 0.6830 提高到 0.7143,在有害建议上将 AUROC 从 0.8219 提高到 0.8582。对于提示级触发基准,我们通过源端安全预算规则来校准 AERIC 阈值,该规则最大化触发覆盖范围,同时将安全触发率限制为最多 10%。根据该规则,对于 Qwen 和 Gemma,trigger@64 在 HarmBench DirectRequest 上分别达到 0.6438 和 0.4656,在 SocialHarmBench 上分别达到 0.6849 和 0.7363,平均扣留 23.53 到 41.86 个答案词元。 Same-pass 部署也很高效:在 Qwen3-8B 下通过 HarmBench DirectRequest 和 SocialHarmBench 聚合的 63 个提示有害提示固定生成基准上,监视器仅增加了 2.34% 的平均延迟,而 Qwen3Guard-Stream-4B 则增加了 79.40%。