论文

Mu-DisCoCat:融合 CLIP 视觉表征与量子电路进行组合泛化

Mu-DisCoCat: A Variational Pipeline for Compositional Generalization on Quantum Processors

模型架构混合架构

摘要

实现组合概念泛化(CoCoGen),即通过重新组合学习的基元来理解新情况的能力,仍然是人工智能中的一个基本挑战。组合语义模型(例如组合分布语义(DisCoCat))通过将向量推广到张量来提供解决方案,但在学习张量时遇到缩放瓶颈。将 DisCoCat 映射到变分量子电路 (VQC) 解决了文本的这一限制,但该方法尚未扩展到多模态情况,例如 CoCoGen 中涉及的情况。本文介绍了 Mu-DisCoCat:一种实现 CoCoGen 的 DisCoCat 多模态变分量子学习框架。该框架首先从单对象图像-文本对中学习稳定的对象表示,然后修复这些表示并使用它们来学习多对象情况下它们之间的关系。在经典仿真中,该模型使用 Uhlmann 状态保真度来计算多模态电路表示之间的重叠,并实现了比评估的 CLIP 基线更高的关系 OOD 精度。其部署是使用跨嘈杂量子模拟器的破坏性 SWAP 测试进行评估的,这些模拟器包括一系列 IBM 假后端、IQM FakeAphrodite 和 IBM Marrakesh 量子处理器。尽管存在现实世界的设备噪声,硬件执行的模型仍与模拟保真度保持很强的正相关性,可靠地区分看不见的相似对和不相似对。我们的工作建立了一个在 VQC 上执行 CoCoGen 的框架,展示了近期量子硬件的可行用例。

Mu-DisCoCat:融合 CLIP 视觉表征与量子电路进行组合泛化:论文原图
图 1:合成图像-标题对齐的多阶段程序。在单对象训练期间优化名词参数之后,学习到的名词参数被转移到关系训练。