论文

To Jev or Not?结构化决策模型用于仇恨言论审核的准确率与效率评估

To Jev or Not? Evaluating the Accuracy and Efficiency of Structured Decision Models for Hate-Speech Moderation

模型评测模型能力评测

摘要

在线内容规模使仇恨言论审核具挑战,而LLM使有害材料更易生产与改编。审核因此需要能容纳不同仇恨言论定义的高效分类器。近期结构化决策模型接受自然语言标准并在指定答案间选择,引出问题:不经任务特定训练它们能否满足这些要求。我们提出HATEDECIDE:在四个仇恨言论数据集上对照专门审核、零样本、商用与监督基线评估六种决策模型配置;考察提供数据集定义或把其分解为多个问题是否改善分类,并测量延迟与成本。发现:商用LLM仅在一个数据集上显著优于全部决策模型;提供定义改变至多28%的预测却不一致改善分类,分解仅在20%的比较中显著改善。在诊断测试集上,最佳托管决策模型距最佳商用LLM仅1.6宏F1而推理成本低约97%。结果识别了廉价审核的机会,同时显示显式标准与附加问题并不可靠地改善分类。