论文
DriftGuard:安全意识多监视器检测和选择性适应不断发展的毒性调节
DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation
摘要
自动毒性调节系统在动态的在线环境中运行,其中有害行为通过编码语言、目标变化和执法策略适应而演变。现有的漂移检测方法通常关注全局分布变化,但此类信号可能会错过局部危害子空间或高风险模型错误区域中出现的与安全相关的变化。本文介绍了 DriftGuard,这是一种安全意识自适应调节框架,它将多监视器漂移检测与选择性模型更新相结合。该框架跟踪全局文本漂移、身份危害漂移、模型不确定性、有毒风险漂移和假阴性风险漂移。当检测到与安全相关的变化时,模型会使用硬混合适应集进行更新,该适应集优先考虑可能的误报、与身份相关的高风险示例、误报风险示例和不确定的边界情况。 Civil Comments 时间转移和 Jigsaw-to-DynaHate 跨数据集转移的实验表明,安全意识监控器可以检测到仅因全球漂移而遗漏的风险。与无更新和随机平衡基线相比,硬混合适应提高了有毒物召回率和准确性,将 Civil Comments 上的有毒物召回率提高到 0.8777,将 DynaHate 上的有毒物召回率从 0.7107 提高到 0.8523。 Bootstrap 分析进一步显示 DynaHate 安全性收益稳定,有毒物质召回率增加 0.1418,假阴性率减少 0.0781。总体而言,DriftGuard 将安全意识漂移检测与有针对性的轻量级模型更新联系起来,以实现更强大的自适应毒性调节。