论文
QEMFN:资源感知的量子多模态融合
Quantum Entangled Multimodal Fusion Networks (QEMFN): Resource-Aware Hybrid Vision-Language Fusion via Trainable Entanglement
摘要
多模态视觉语言系统通常通过串联、注意力、双线性池或张量交互等经典算子融合图像和文本嵌入。我们提出了量子纠缠多模态融合网络(QEMFN),这是一种混合量子经典框架,引入参数化纠缠作为多模态融合的结构化归纳偏置。预先训练的视觉和文本特征被投影到紧凑的潜在空间中,编码为角度参数化的量子态,通过模内和成对的跨模态纠缠电路进行处理,并进行测量以产生用于检索的融合表示。在匹配的参数预算和相同的冻结 CLIP 骨干模型 下,QEMFN 优于 COCO-5k 和 Flickr30k 上的经典融合基线,包括多层感知器、张量融合、FiLM、交叉注意力、紧凑Transformer和反量化配对拓扑模拟。 消融 套件将量子模块的贡献与周围的经典投影隔离开来,以量子为中心的分析报告了 Meyer-Wallach 纠缠能力、可表达性、梯度相对于贫瘠高原边界的方差,以及在训练进展控制下的熵性能相关性以及对纠缠组件的干预研究。 QEMFN 在基于镜头的估计、噪声建模假后端和具有零噪声外推的真实超导设备下执行。这项工作并没有声称量子计算的优势;贡献在于该框架以及受控的经验和以量子为中心的评估,将 可训练纠缠定位为可解释的、硬件可执行的融合机制,其规模可在当代设备上访问。
