论文
ValueGround:评估 MLLM 中文化条件下的视觉价值基础
ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs
摘要
文化价值观不仅通过语言表达,还通过视觉场景和日常社会实践表达。然而,现有的语言模型中对文化价值观的评估几乎完全是纯文本的,因此当反应选项可视化时,文化条件判断是否保持稳定尚不清楚。我们引入了 ValueGround,这是一个评估多模态 大语言模型 (MLLM) 中文化条件视觉价值基础的基准。 ValueGround 根据世界价值观调查问题构建,使用最低对比度的图像对来表示相反的响应选项,同时控制不相关的变化。给定一个国家、一个问题和一个图像对,模型必须选择最符合该国家价值倾向的图像,而无需访问原始的回答选项文本。在 6 个 MLLM 和 13 个国家进行的实验表明,使用可视化响应选项的模型比使用原始文本选项的模型表现要差得多,平均准确度从 72.8% 下降到 62.6%。我们的基准提供了一个受控测试平台,用于研究文化条件价值判断的跨模式转移。