论文

mllm-shap:文本音频多模式的 Shapley 价值可解释性平台 大语言模型

mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

我们引入了 mllm-shap,这是一个开源 Python 框架,旨在将 Shapley Value (SV) 可解释性从纯文本 大语言模型 扩展到处理联合文本和音频输入的多模态 LLM (MLLM)。虽然基于文本的归因已得到充分研究,但 mllm-shap 解决了多模态机制特有的三个关键挑战:(1)模态感知联盟掩码,它管理离散文本标记和密集音频编码器帧的交错处理。 (2) 多轮对话跟踪,利用每个词元元数据来维护角色和模态上下文。 (3) 基于语音对齐的标记分组,这是一种新技术,可将联盟空间减少 10 倍到 50 倍,使长格式音频的 SV 估计在计算上可行。该平台实施五种 SV 估计策略,包括具有内曼最优分配的互补贡献 (CC) 估计器,该估计器表现出优于标准蒙特卡罗基线的收敛性。 mllm-shap 作为 pip 安装包提供,具有基于 Web 的交互式 GUI,用于精细归因可视化。据我们所知,这是第一个公开可用的框架,为文本音频 MLLM 中基于 SV 的可解释性提供完整的、可重复的管道。