论文

CATCH-ME if you RAG:针对仇恨和错误信息交换的上下文注释多轮反言论数据集

CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges

模型评测基准与评测资源

摘要

网络仇恨言论和错误信息经常重叠,但 NLP 研究主要将它们分开对待。虽然 LLM 代表了一种可扩展的解决方案,可帮助人类针对这两种威胁生成反语音,但零样本模型经常生成重复且模糊的响应,这强调了需要高质量的示例来引导模型生成。然而,现有的针对仇恨和错误信息重叠的反语音数据集很少,并且仅限于单轮英语对话,而现实生活中的互动则跨越多个轮次和语言。为了弥补这一差距,我们引入了第一个大规模、专家策划的多语言对话数据集,以解决仇恨和错误信息的交叉问题。为了确保事实依据,对话还以经过验证的外部知识(即事实核查文章和非政府组织报告)为基础,并包括文档和块级跨度注释,使其直接适用于 RAG 系统。这一新颖的资源涵盖五种语言,针对七个边缘群体的仇恨,能够训练和评估更具说服力、基于事实的反言论模型。