论文

Pluralis v0.1:迈向人工智能风险和可靠性的多文化、多模式、多语言基准

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

模型评测安全与风险评测

摘要

当前的人工智能安全评估和基准测试框架主要依赖于以西方为中心的与文化无关的默认设置,这些默认设置掩盖了关键的地区法律、社会语言的细微差别和文化禁忌,使得视觉语言模型(VLM)在全球部署中容易受到攻击。我们介绍 Pluralis v0.1:一个从文化优先的角度构建的新颖的多模式、多区域和多语言数据集。 Pluralis 跨越 6 个亚太国家(孟加拉国、印度、韩国、巴基斯坦、新加坡、台湾)和 8 种语言,提供 6,448 条提示,与之前的工作不同,它直接获取本地化的安全隐患,而不是采用西方数据集。至关重要的是,它引入了一种多模式评估范式:用户文本(例如,“我应该赠送这个吗?”)和涉及“这个”的图像(例如,时钟)——两者孤立无害,但协同触发特定的法律或文化违规行为。 Pluralis 将普遍的安全违规行为与当地的文化适宜性区分开来,将后者确立为一流的评估轴。为了实现这一点,我们提出了 Judge-Pluralis,这是一个协议门控的 LLM-as-a-Judge 集成体,根据经验得出的文化分类法中分类的示例进行训练。观察 Pluralis 表面子集上的 VLM 行为,发现反复出现的特定于区域的故障模式,例如造成下游损害的图像错误识别、错过的项目-上下文-区域交互以及不充分的拒绝。这些故障模式因地区和语言的不同而系统性地变化,暴露了全局平均指标所掩盖的盲点。最终,Pluralis 并不是作为一个已解决的文化一致性评估框架,而是作为未来创新的第一步和催化剂。我们呼吁研究界利用这一基础来推进多语言、多文化评估科学,以更好地支持全球人工智能文化协调。