论文
大声说,读不同:多模态模型中的跨模态不稳定性
Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
摘要
多模态基础模型越来越多地用于语音优先助理,这些助理必须解释口头查询并生成基于视觉的决策。然而,尚不清楚语义等效的查询是否能在模态(文本与语音)和语言(英语与阿拉伯语)之间产生一致的判断。我们引入了一种语音增强视觉对比三元组基准,涵盖来自 18 个 MENA 国家的 10,150 个文化基础图像,其中每个图像都与一个受支持的陈述和两个看似合理但不受支持的替代方案配对。我们将对比不稳定性定义为模型无法解决三元组内所有语句的条件率,从而将支离破碎的推理与完全失败隔离开来。在评估英语和阿拉伯语文本和语音下的最新多模态模型时,我们发现模态和语言的转变引入了实质性的三重级不一致,这些不一致不能被总体准确性完全捕获,并且语音放大了部分故障。我们向社区公开提供该基准。