论文
MMVIAD:用于工业异常检测的多视图多任务视频理解
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
摘要
工业异常检测对于制造质量控制至关重要,但现有数据集主要集中于静态图像或稀疏视图,不能完全反映真实工业场景中的连续检测过程。我们介绍了 MMVIAD(多视图多任务视频工业异常检测),据我们所知,这是第一个用于工业异常检测和理解的连续多视图视频数据集,以及多任务评估的基准。 MMVIAD 包含以对象为中心的 2 秒检查片段,摄像机运动角度约为 120 度,涵盖 48 个对象类别、14 个环境和 6 种结构异常类型。它支持异常检测、缺陷分类、对象分类和异常可见时间定位。对 MMVIAD 的系统评估表明,当前的商业和开源视频 MLLM 仍远低于人类表现,特别是在细粒度缺陷识别和时序定位方面。为了提高可转移异常的理解,我们进一步开发了一个两阶段的 后训练 管道,其中 PS-SFT(感知结构监督 微调)初始化感知结构推理,VISTA-GRPO(基于可见性的工业结构化时间异常组相对策略优化)通过语义门控缺陷奖励和可见性感知时间奖励细化模型,产生最终模型 VISTA。在 MMVIAD-Unseen 上,VISTA 将基础模型在四项任务中的平均得分从 45.0 提高到 57.5,超过了 GPT-5.4。源代码可在 https://github.com/Georgekeepmoving/MMVIAD 获取。