论文

MOPDA:用于语言引导工业异常检测的混合轨迹 同策略 蒸馏

MOPDA: Mixed-Trajectory On-Policy Distillation for Language-Guided Industrial Anomaly Detection

摘要

大型视觉语言模型(LVLM)通过提供图像级异常判断和可解释推理,在工业异常检测(IAD)方面显示出强大的潜力。然而,将生成的判断可靠地转化为精确的像素级定位仍然具有挑战性。我们提出用于语言引导工业\textbf{A}异常检测(MOPDA)的\textbf{M}固定轨迹\textbf{O}n-\textbf{P}olicy\textbf{D}蒸馏,这是第一个将同策略自蒸馏引入基于LVLM的IAD的框架。对于判断学习,\method 引入了 \textbf{混合轨迹监督},将学生生成的 同策略 轨迹与共享 词元级 蒸馏 目标下的证据条件教师轨迹相结合。学生轨迹保留对与部署相关的响应路径的监督,而教师轨迹提供补充的证据条件监督。对于密集定位,\textbf{语言引导视觉锚定}使用最终判断作为紧凑语义条件来构造图像特定的正常和异常锚点,与密集视觉特征对比以生成异常图。这使得语言成为语义指导,同时将像素级响应置于视觉证据中。在五个 IAD 基准的严格跨数据集零样本协议下,该方法在大多数检测、定位和判断指标上优于基于 LVLM 评估的基线,同时与基于 CLIP 的方法保持竞争力。消融进一步验证了混合轨迹监督和最终判断调节。