论文

FailSAE:通过稀疏自动编码器实现视觉语言模型的可解释故障预测

FailSAE: Towards Interpretable Failure Prediction for Vision-Language Models via Sparse Autoencoders

模型评测评测方法与指标

摘要

CLIP 等视觉语言模型 (VLM) 通过在共享嵌入空间中对齐视觉和文本表示,在多模式任务中取得了出色的性能。随着 VLM 越来越多地用于高风险领域,故障预测对于风险感知部署和人工干预变得至关重要。现有的故障预测方法通常依赖于置信度分数或辅助分类器。尽管这些方法可以有效预测 VLM 故障,但它们的可解释性有限。在这项工作中,我们研究了稀疏自动编码器 (SAE) 在 VLM 中进行可解释故障预测的用途。我们将故障预测制定为稀疏 SAE 潜在激活的分类任务,并引入三阶段故障感知训练管道,鼓励学习的潜在方向保持可解释性,同时为故障预测提供更多信息。我们的实验表明,所得框架在故障预测方面优于评估的基线。进一步的分析表明,故障意识训练鼓励 SAE 潜在方向捕捉更多特定于班级的概念。我们还使用 SAE 提供模型表示在故障期间如何变化的概念级分析,揭示从特定于类的概念向更模糊或与风格相关的概念的转变。最后,我们探讨了学习到的 SAE 潜在方向如何支持运行时故障恢复。