论文
虚张声势:通过有序推理链正则化检测不断变化的有害聊天对话
Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization
摘要
有害的聊天对话通过类型转换和词汇逃避而不断变化,但我们发现它们共享不变的原则,即重复出现的主题、伤害语言指标、严重程度层次结构和类型特征的有序推理链(ORC),这可以帮助我们捕获频繁变化的词汇表达中的关键信息。我们提出 BRACE,它将 ORC 编码为具有中间监督的四个可微阶段(主题 -> 指标 -> 严重性 -> 类型),充当与直接头混合的结构化正则化器,并由基于原型的特征增强和特征路径解开支持。评估结果显示,在 4 个领域和 5 个危害类别中,BRACE 实现了 0.934 的危害类型宏 F1(RoBERTa-wwm-ext,3-seed 平均值),解码器主干(Qwen3-1.7B LoRA)达到 0.949。消融研究表明,所有组件都对 BRACE 做出贡献,ORC 的结构分解使 BRACE 能够区分语义模糊的有害类型。免责声明:本文可能包含令某些读者感到不安的内容。