论文
基金会模型可以管理在线内容吗?评估指导与示例驱动的政策实施
Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization
摘要
内容审核政策日益复杂,对其持续实施提出了严峻挑战。虽然基础模型具备应对这一挑战所需的基本能力,但它们是否能够可靠地调节在线内容仍然是一个悬而未决的问题。在本文中,我们系统地比较了视觉语言模型(VLM)指导的两种竞争范式:一种是指令驱动的方法,其中模型根据政策规则进行推理;另一种是示例驱动的方法,其中模型从先前的先例中进行概括。我们在 ModerationBench 中进行了这项调查,这是一个新基准,包含来自 Bluesky 平台的 4,000 条手动注释的野外帖子。我们的实验表明,基础模型的性能可以大大优于 Bluesky 部署的审核系统,其在基准随机帖子上的 $F_1$ 得分几乎是其三倍(0.60 与 0.22),并且指令驱动和示例驱动的范例都达到了可比的峰值有效性。因此,我们的研究结果为大规模可靠且适应性强的政策实施指明了道路。