论文
当仇恨遇到事实:LLM 在环中用于仇恨言论中的检查价值检测
When Hate Meets Facts: LLMs-in-the-Loop for Check-worthiness Detection in Hate Speech
摘要
网上的仇恨内容通常使用事实性的、不一定正确的信息来表达,特别是在协调一致的在线骚扰活动和极端主义宣传中。如果未能共同解决仇恨言论 (HS) 和错误信息,可能会加深偏见,强化有害的刻板印象,并使旁观者面临心理困扰,同时污染公共辩论。此外,这些消息需要内容审核者付出更多努力,因为他们必须评估危害性和真实性,即对它们进行事实检查。为了应对这一挑战,我们发布了 WSF-ARG+,这是第一个将仇恨言论与检查价值信息相结合的数据集。我们还引入了一种新颖的 LLM-in-the-loop 框架,以方便对值得检查的声明进行注释。我们运行我们的框架,并使用 12 个不同大小和架构的开放权重 LLM 对其进行测试。我们通过广泛的人工评估对其进行了验证,并表明我们的 LLM 循环框架在不影响数据注释质量的情况下减少了人工工作量。最后,我们表明,具有值得检查的声明的 HS 消息显示出明显更高的骚扰和仇恨,并且合并值得检查的标签可将大型模型的基于 LLM 的 HS 检测平均提高至 0.213 宏 F1 和 0.154 宏 F1。