论文
T-CLIP:为对比语言图像预训练启用热感知
T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining
摘要
在低照度和恶劣天气等具有挑战性的条件下,热成像为可见光谱视觉提供了强大的替代方案,但由于基本的热感知差距,像 CLIP 这样的基础视觉语言模型无法将热图像与文本描述对齐。我们确定了三个主要挑战:缺乏标题热数据集、标准 LLM 无法推理热现象,以及热成像中的一个关键代表性挑战,即在单个嵌入空间中一起学习时,全局场景上下文和对象级热特征会发生冲突。为了解决这些问题,我们引入了 IR-Cap(第一个物理感知热字幕管道和数据集,可在三个公共基准中提供互补的全局和细粒度热描述)和 T-CLIP(一种解耦的双 LoRA 框架,可独立调整 CLIP 以实现场景级和对象级热理解)。 T-CLIP 在跨模式检索的三个热基准中实现了对所有基线的一致改进,并且我们提供了其对文本条件热图像生成的适用性的探索性演示。