论文

COLIP-2:统一嗅觉、视觉与语言的嵌入空间

COLIP-2: Olfaction-Vision-Language Embeddings

模型训练预训练

摘要

对比嗅觉语言图像 预训练 2 (COLIP-2) 模型是一个多模态嵌入空间,将嗅觉置于视觉和语言中的一等公民。分子结构、气体传感器读数、气味描述符语言和图像都被训练到单个共享表示空间中,以便机器人可以概率地将检测到的香气定位到场景中的物体。当前不存在 ImageNet 规模的图像—气味配对数据集,因此需要收集此类数据。我们发布 COLIP-2 的目的是展示使用开源嗅觉数据为机器人技术构建的局限性,以便为为什么需要新的方法和数据集来实现先进的嗅觉导向感知能力的论点奠定基础。我们列举了 COLIP-2 架构内部测试的结果,并进行了必要的优化,以便在实时机器人应用程序的边缘运行模型。虽然 COLIP-2 的设计考虑到了机器人技术,但它的设计受到了学术界和工业界许多科学学科专家的影响,我们希望该模型能够在任何需要嗅觉智能的多模态领域发挥作用。