论文

从视觉语言的角度重新审视阴影检测

Revisiting Shadow Detection from a Vision-Language Perspective

应用与实践视觉感知与空间理解

摘要

阴影检测通常被表述为视觉驱动的密集预测问题,其中模型主要依靠像素级视觉监督来区分阴影与非阴影区域。然而,在视觉模糊的情况下,这种公式可能变得不可靠,其中类似的黑暗区域可能对应于投射阴影或本质上黑暗的表面,使得仅视觉证据不足以建立稳定的决策规则。在这项工作中,我们从视觉语言的角度重新审视阴影检测,并认为稳健的预测受益于超越视觉线索的显式语义参考。我们提出了 SVL,一种阴影视觉语言框架,它使用语言作为明确的语义参考来消除视觉上相似的黑暗区域中的阴影的歧义。 SVL 通过场景级阴影比率回归将全局图像表示与阴影相关文本嵌入对齐,并通过全局到局部耦合和局部块级约束将这种语义指导转移到密集预测。 SVL 基于冻结的 DINOv3 图像编码器构建,仅学习轻量级投影和解码模块,从而产生参数高效的设计,可训练参数少于 1\%$。对多个阴影检测基准的广泛实验(包括专用的硬案例评估)表明,在视觉模糊条件下具有强大的整体性能和改进的鲁棒性。代码可在 https://github.com/harrytea/SVL 获取。