论文

ProBel:利用技术、跨度和解释进行宣传检测

ProBel: Propaganda Detection with Techniques, Spans, and Explanations

模型评测基准与评测资源

摘要

宣传检测包括几个相关的预测级别,从句子级决策到技术分类和跨度识别。然而,目前尚不清楚这些级别的监督在阿拉伯语和英语联合学习时如何相互作用。我们推出了 ProBel,一种阿拉伯语和英语资源,可对齐二进制标签、23 种宣传技术的多标签注释(分为六个粗略类别)、技术标记的跨度以及相同新闻句子的参考解释。它包含更大的英语集合,并支持两种语言的匹配二进制、粗粒度、多标签和跨级别任务。我们评估零样本提示、特定任务 微调 以及共享设置下的联合训练。单个双语多任务模型可以实现最佳的整体性能,并且在跨任务和语言之间保持竞争力。跨任务分析表明,迁移取决于监督级别。联合分类训练保留了二元性能,而仅跨度训练会削弱句子级预测。联合双语训练产生最稳定的结果,而单语 微调 可以减少向其他语言的迁移。我们将发布数据、代码和评估脚本。