论文
大锤还是手术刀?针对隐性仇恨言论的细粒度自适应框架
Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech
摘要
与带有明显脏话的明确攻击不同,隐性仇恨言论通过隐喻和上下文提示将恶意隐藏在看似顺从的表达中,这使得在线内容审查中的检测具有挑战性。虽然现有的基于 PLM 或 LLM 的方法表现良好,但它们通常对所有样本应用单一推理过程。这忽略了细粒度的语言细微差别,并导致对更简单的情况进行不必要的计算。我们观察到,网络仇恨言论并不是单一的,而是以多种形式表现出来。因此,我们定义了三个细粒度的类别:浅层、目标和上下文相关。因此,我们提出了细粒度自适应隐式仇恨语音检测(FAID),这是一种新颖的框架,首先执行细粒度分类,然后适应特定类别。具体来说,对于具有表面可识别意图的浅层样本,该框架采用轻量级提示调整来快速分类;对于将恶意意图与隐藏目标绑定的定向评论,我们设计了知识增强来迭代完善模型并揭示隐藏目标;对于缺乏背景信息的上下文相关评论,我们利用代理框架自动生成提示来发展上下文、推断缺失的背景信息并识别模糊的恶意意图。这种自适应架构将计算资源集中在复杂的隐式样本上,同时避免了浅层样本的冗余推理。对四个基准数据集的实验表明 FAID 显着优于 SOTA 基线。