论文

面向无障碍灾害救助的跨文本与音频模态多模态LLM评测

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

模型评测鲁棒性、公平性与可信度评测

摘要

有效的灾害风险传播是一项基础性人道主义挑战,然而当前的应急基础设施未能满足有获取障碍与功能性需求人群的需要,包括听障人士、孕妇、携带幼童的母亲以及患痴呆症的老年人。人工智能(AI)的最新进展,尤其是多模态大语言模型(MM-LLM),展现出在单一统一系统(如聊天机器人)内跨文本、音频、图像与视频模态服务多样化用户的强大能力。然而,它们是否适合部署取决于一个受关注有限的属性:无论用户通过何种模态沟通,这些系统是否都能产出一致、可行动的输出。本文利用真实紧急警报场景,对开源MM-LLM在四种不同弱势人群画像下的表现进行了全面分析。这些最先进(SOTA)模型在相同任务场景下被评估其跨文本与音频模态回复的一致性。结果表明,没有任何模型能实现跨模态的可靠一致性,且有获取需求人群画像的性能差距更大,引入了削弱这些系统人道主义价值的模态依赖性不平等。这些结果为构建公平、可信、包容的灾害风险传播AI工具提供了具体的设计建议。

面向无障碍灾害救助的跨文本与音频模态多模态LLM评测:论文配图
图1:AudioFlamingo 与 SALMONN 模型中跨模态不一致的示意:通过文本与音频两种模态提交的同一紧急查询,得到了一个详细、可操作的文本回复以及一个泛泛的。