论文

JUDO:用于工业异常 QA 的并列面向领域多模态推理器

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

模型训练监督微调与指令调优

摘要

大型多模态模型 (LMM) 极大地推进了工业异常检测,使各种人类指令无法检测,特别是通过基于视觉的推理来更好地理解图像。然而,LMM 缺乏特定领域的知识,这限制了它们在复杂的工业场景中生成准确响应的能力。在这项工作中,我们提出了 JUDO(并列面向领域的多模态推理器),这是一个在视觉和文本推理中有效整合领域知识和上下文的框架。通过视觉推理,我们的模型通过将查询图像与正常图像并置作为视觉域上下文来分割缺陷区域,从而实现细粒度的视觉比较检查。此外,我们通过有监督的 微调 (SFT) 注入领域知识,以增强上下文理解,随后通过带有定制奖励的强化学习 (GRPO) 指导领域推理,选择面向领域的推理过程。实验结果表明,JUDO在MMAD基准上取得了优异的性能,超越了Qwen2.5-VL-7B和GPT-4o等模型。这些结果凸显了增强领域知识和背景对于异常理解中有效推理的重要性。