论文
粉饰仇恨、抹黑无害内容:对基于LLM的审核的注释者式反驳攻击
Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation
摘要
大语言模型 (LLM) 越来越多地用于仇恨言论审核,通常在人类-人工智能工作流程中,审阅者在最终决定之前提供反馈。这种反馈引入了两个操纵方向:将仇恨内容粉饰为正常内容,以及将正常内容抹黑为仇恨内容。本研究检查了最初正确的模型判断对注释器式反驳的敏感性,并分析了攻击有效性在不同操作方向上是否存在差异。我们引入了一种重新判断协议,该协议扩展了与决策边界扰动和对抗性原理的直接矛盾。在两个仇恨语音数据集上使用多个 LLM 进行的实验表明,注释器式反驳会大大降低审核性能,在多轮设置中效果更强。结果进一步揭示了攻击配置中的粉饰和抹黑之间稳定的、特定于模型的不对称性,表明了不同的方向性漏洞模式。明确的推理提示和防御性指令可以减少这些影响,但不能消除它们。这些发现强调了在人类-人工智能审核工作流程中需要有方向意识的保障措施和专门的反馈鲁棒性评估。