论文

AnomalyClaw:基于工具的反驳的通用视觉异常检测代理

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

智能体系统Agent 工具调用

摘要

视觉异常检测(VAD)在工业检测、医学成像、基础设施监控和遥感等许多现实领域中至关重要。然而,跨不同领域的特定异常定义、数据模式和注释标准使得单领域训练的 VAD 模型的迁移变得困难。在大规模跨域数据上进行预训练的视觉语言模型(VLM)可以在任务指令下执行视觉感知,为跨域VAD提供了一种有前景的解决方案。然而,单推理 VLM 判断并不可靠,因为它们更多地依赖于先验知识,而不是正常样本参考或细粒度特征证据。因此,我们提出了 AnomalyClaw,一个 无需训练 VAD 代理,它将异常判断转变为多轮反驳过程。在每一轮中,代理都会提出候选异常,并根据正常样本参考反驳每个异常,利用 13 个工具库进行视觉验证、参考解析和冻结专家探测。在 CrossDomainVAD-12 基准测试(12 个数据集)上,AnomalyClaw 相对于单步直接推理实现了一致的宏观 AUROC 改进,在 GPT-5.5 上实现了 +6.23 pp,在 Seed2.0-lite 上实现了 +7.93 pp,在 Qwen3.5-VL-27B 上实现了 +3.52 pp。我们进一步引入可选的语言化自我进化扩展。它根据内部分支分歧建立了一个在线规则手册,没有预言标签。在 Qwen3.5-VL-27B 上,它提供了 +2.09 pp 平均增益,与 K = 10 oracle-label 监督基线 (+1.99 pp) 相当。这些结果表明,代理反驳提高了 VLM 的异常理解和推理,而不仅仅是聚合工具输出。