论文
评估内容审核中 大语言模型 的标准条件行为
Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation
摘要
大语言模型 (LLM) 在标准内容审核基准上表现出强大的性能。然而,这些基准通常将多个审核标准聚合到一个标签中,从而不清楚模型是否可以理清它们并在做出决策时可靠地应用每个标准。为了研究 LLM 是否表现出标准条件行为,我们引入了内容诊断评估 (DECO),这是一种独立于标准的内容因式分解,可实现受控的标准级别评估。我们还引入了成对评估来比较相同输入的不同标准的模型输出。在四个审核数据集和四个 LLM 中,我们发现强大的基准性能可以隐藏标准级别的重大故障。当正确的决策不取决于整体危害性,而是取决于标准要求模型评估的内容的特定方面时,模型就会陷入困境。我们的结果凸显了当前内容审核基准的一个关键限制:聚合标签的强劲表现并不能提供足够的证据表明 LLM 可以根据个人审核标准可靠地评估内容。这些发现呼吁开发明确衡量标准条件行为的评估方法。