论文
用 SMILE(Statistical Model-agnostic Interpretability with Local Explanations)解决生成式 AI 的可解释性问题
Addressing Explainability of Generative AI using SMILE (Statistical Model-agnostic Interpretability with Local Explanations)
摘要
生成式人工智能的快速发展催生了能产出复杂文本与视觉输出的模型;然而其决策过程大多不透明,限制了高风险应用中的信任与问责。本论文提出 gSMILE,一个面向生成模型可解释性的统一框架,将 Statistical Model-agnostic Interpretability with Local Explanations(SMILE)方法扩展到生成场景。gSMILE 采用受控的文本输入扰动、Wasserstein 距离度量与加权代理建模,量化并可视化提示或指令的特定成分如何影响模型输出。应用于大语言模型(LLM)时,gSMILE 提供细粒度的 token 级归因,并生成直观热力图,突出有影响的 token 与推理路径。在基于指令的图像编辑模型中,采用相同的文本扰动机制,可以分析对编辑指令的修改如何影响生成图像。结合基于 Operational Design Domain(ODD)框架的场景化评估策略,gSMILE 可跨多样语义与环境条件系统评估模型行为。为评估解释质量,我们定义了严格的归因指标,包括稳定性、保真度、准确性、一致性与忠实性,并将其应用于多种生成架构。大量实验表明,gSMILE 产出稳健、与人类对齐的归因,并能有效泛化到最先进的生成模型。这些发现凸显了 gSMILE 推动生成式 AI 透明、可靠与负责任部署的潜力。
