论文
PluRule:社交媒体上调节多元化社区的基准
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
摘要
社交媒体正在转向多元化——社区管理的平台,团体可以在其中定义自己的规范。在一个社区违反规则的行为在另一个社区可能是完全可以接受的。人工智能模型可以帮助调节这种多元化社区吗?我们将任务形式化为多项选择问题,反映了人类版主在现实世界中的运作方式:给定评论及其周围的上下文,确定违反了哪条特定规则(如果有)。我们推出了 PluRule,这是一个多模式、多语言基准,用于检测 1,989 个 Reddit 社区中的 13,371 条规则违规行为,涵盖 9 种语言的 2,885 条规则。使用这个基准,我们表明最先进的视觉语言模型表现得非常挣扎:即使具有高推理能力的 GPT-5.2 的表现也只比普通基线稍好一些。我们还发现,更大的模型和更多的背景可以提供边际收益,并且文明和自我推销等普遍规则更容易被发现。我们的结果表明,社交媒体上多元化社区的调节是语言模型面临的根本挑战。我们的代码和基准是公开的。