论文

看和嗅:学习视觉嗅觉表征

See & Sniff: Learning Visuo-Olfactory Representations

模型训练预训练

摘要

虽然现代多模态模型将视觉与语言、音频或触觉相结合,但由于缺乏配对的视觉嗅觉数据,嗅觉在很大程度上仍未得到探索。我们引入了 SmellNet-V,这是一个可扩展的视觉嗅觉数据集,其基础是气味识别对于语义类别内的视觉转换在很大程度上是不变的。这使我们能够将仅气味样本与语义对齐的野外网络图像进行综合配对,将单模态嗅觉数据集转换为跨模态基准,而无需昂贵的联合收集。在此数据集的基础上,我们提出了 See & Sniff,这是一个自我监督框架,通过密集的局部对齐学习联合视觉嗅觉表征,并自然地生成气味显着性图,以实现气味源的空间定位。我们进一步介绍像素级气味定位任务和评估基准。我们的方法在从单独气味的气味分类中超出了仅气味基线 7%,并推广到跨模态检索和气味定位,将视觉嗅觉学习确立为多模态感知的新方向。