论文
ThreatCore:显式和隐式威胁检测的基准
ThreatCore: A Benchmark for Explicit and Implicit Threat Detection
摘要
自然语言处理中的威胁检测缺乏一致的定义和标准化基准,并且经常与更广泛的现象(例如毒性、仇恨言论或攻击性语言)混为一谈。在这项工作中,我们介绍了 ThreatCore,这是一个用于细粒度威胁检测的公共可用基准数据集,可区分显式威胁、隐式威胁和非威胁。该数据集是通过聚合多个公开可用的资源并在统一的威胁操作定义下系统地重新注释它们来构建的,揭示了现有标签之间的实质性不一致。为了提高代表性不足的案例(特别是隐性威胁)的覆盖率,我们进一步使用合成示例来扩充数据集,这些示例使用与公共数据集重新注释所采用的相同注释协议进行手动验证,从而确保所有数据源的一致性。我们在 ThreatCore 上评估 Perspective API、零样本分类器和最新语言模型,结果表明隐式威胁仍然比显式威胁更难检测。我们的结果还表明,将语义角色标签合并为中间表示可以通过使有害意图的结构更加明确来提高性能。总体而言,ThreatCore 为研究细粒度威胁检测提供了更一致的基准,并强调了当前模型在识别有害意图的间接表达方面仍然面临的挑战。