论文
NormViz:在全球文化中奠定多模态推理基础的基准和框架
NormViz: A Benchmark and Framework for Grounding Multimodal Reasoning in Global Cultures
摘要
人工智能系统在全球范围内得到应用,但它们很难满足不同文化人群的需求。之前关于文化理解的工作评估了人工智能系统在纯文本设置或视觉文化物品识别(例如食物、服装)方面的情况。通过当地社会规范推理视觉可观察行为的能力,我们称之为视觉规范理解,仍然未经检验。我们推出 NormViz-Bench,这是一个经过人工验证的高质量基准,包含 16 个国家/地区的 3,268 个对比图像对(6,536 张图像)。每对仅在文化相关行为(例如物体、属性、空间关系和动作)上有所不同,这些行为改变了每个图像的解释方式。每张图像都被标记为符合、违反或与当地社会规范无关,并且配对评估要求两张图像都被正确分类,从而防止依赖于肤浅的视觉捷径。即使是最强大的 VLM,Gemini 3.0 Flash 和 Qwen2.5 VL 7B,也只能在 26.6% 和 21.6% 的配对上取得成功,在识别违规和文化良性视觉行为方面最为困难。为了弥补这一点,我们引入了 NormViz-Train,这是一个包含 64k 图像并配有解释的训练数据集。尽管绝对性能仍然较低(<30%),但 NormViz-Train 上的微调将 Qwen3-VL 4B 和 8B 的配对准确度相对提升最高分别为 125% 和 36%,为教会模型将视觉感知与文化意义联系起来提供了一条前进的道路。 NormViz-Bench 和 NormViz-Train 共同将视觉规范理解确立为多模态 AI 的一个具有挑战性且重要的前沿领域。