论文

更难防御:通过隐式增强和混淆重写应对中国恶意攻击

Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

模型评测安全与风险评测

摘要

大语言模型 (LLM) 需要超出明确措辞的稳健毒性评估。这种设置在中文中仍未得到充分探索,其中毒性可能会将语义间接性与表面混淆结合起来。我们引入了中国隐式毒性攻击(CITA),这是一种受控的红队评估和防御数据生成框架,而不是可部署的规避工具。 CITA 使用三个阶段:(i) 有害意图学习,(ii) 隐式毒性增强,以及 (iii) 混淆变体重写,以保留有害意图、增加隐含性并添加受控表面变体。在 CITA 生成的评估样本上,7 个测试的探测器存在较大的漏检风险,平均 ASR 达到 69.48%;人类评估进一步证实了保留的危害性和增加的隐含性/回避性。作为下游防御应用,我们使用 CITA 生成的红队数据对中国隐式毒性防御模型(CITD)进行微调,表明此类数据可以通过额外的训练来提高鲁棒性。