论文

ToxiREX:ConteXt 中有毒推理的数据集

ToxiREX: A Dataset on Toxic REasoning in ConteXt

模型评测安全与风险评测

摘要

我们引入了一个新的、上下文相关的多语言数据集,称为 ToxiREX:ConteXt 中的 Toxic REasoning。该数据集由 Reddit 评论线索和评论暗示的结构化特征组成,遵循前一篇论文中开发的系统性有毒推理模式。使用该模式使我们能够捕获和解释隐含的和上下文相关的毒性,同时支持到现有毒性分类法的映射。该数据集包括六种语言的评论(英语、阿拉伯语、土耳其语、西班牙语、德语和荷兰语),这些评论是从与特定重大事件(例如 2023 年土耳其地震;俄罗斯入侵乌克兰)相关的帖子中收集的。我们描述了线程的上下文保留预处理。我们创建了一个包含 125,000 条评论的训练集,由商用 LLM 注释,以及一个包含近 3000 条评论的测试集,由母语人士注释。我们表明,测试集注释中的明显分歧通常反映了合理的替代解释,而不是噪音。最后,我们通过提示和 微调 语言模型提供基线结果。为了产生这些结果,我们为基于模式的分层预测制定了评估策略。虽然模型的表现优于随机模型,但仍有很大的改进空间,这表明该任务具有挑战性。 ToxiREX 是第一个同时包含多种语言、对话上下文和隐含毒性的数据集,同时使用有毒推理模式进行丰富的结构化注释。数据集位于:https://github.com/cltl/toxirex