论文
RobustMAD:评估可部署异常检测助手的多模式小语言模型的现实鲁棒性
RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants
摘要
多模式工业异常检查助手是下一代智能工厂的关键组成部分,可实现基于视觉语言的交互式查询。然而,由于计算需求过高以及基于云的推理带来的隐私风险,多模态 大语言模型 对于现场部署仍然不切实际。紧凑的多模态小语言模型(MSLM)提供了一种可部署的替代方案,但由于缺乏全面的稳健性分析和反映现实世界工业条件的有意义的挑战性基准,进展受到限制。为了解决这一差距,我们开发了 RobustMAD,这是第一个部署驱动的基准测试,旨在通过涵盖对象理解、异常检测、无法回答的问题和视觉质量下降的各种开放式查询来全面评估模型的稳健性。与传统假设相反,性能最佳的 MSLM 表现出有前途的能力,令人惊讶的是甚至超过了更大的 GPT-5 Nano。然而,它们仍然达不到安全关键要求,并且 RobustMAD 揭示了带来运营风险的关键稳健性差距。特别是,出现了三种反复出现的故障模式:(i)细粒度区分或退化视觉条件下脆弱的多模式基础,(ii)响应不够全面,以及(iii)无法回答或不适定查询的逻辑基础薄弱,导致幻觉输出。基于这些见解,我们为下一代多模式工业检测助手的设计提供了可操作的指导,以充分利用其有前景的能力。代码可在 https://github.com/en-research/RobustMAD 获取。