论文

潜在多模态知识的中心谱激活

Hub-Spectral Activation of Latent Multimodal Knowledge

模型推理推理验证与自校正

摘要

多模态表示学习寻求跨模态检索和知识转移的共享表示。基于集线器的绑定降低了成对监督成本,但单独的集线器连接无法保证在没有直接联合训练的情况下模式之间的可靠对齐。我们引入了集线器谱激活(HSA),这是一种封闭形式的方法,用于恢复和激活冻结表示中潜在多模态知识的集线器可读组件。我们将这种知识形式化为源引起的跨模式依赖性,并表征由两个经过训练的集线器边缘的二阶统计数据确定的分量。在二阶源模型下,我们建立了精确恢复完整源引发关系的条件,并通过集线器协方差秩来限制其集线器可读组件的维度。 HSA 组合并标准化中心边缘统计数据,提取配对光谱方向,并将可靠性加权匹配证据与源门控候选分辨率相结合,以进行双向检索和原型分类。 HSA 不需要目标对监督、梯度优化或主干网更新。在 ImageBind 和 LanguageBind 上的 19 个检索和 11 个原型分类关系中,HSA 将平均双向 Recall@10 从 18.27% 提高到 31.15%,将平均宏 Top-1 准确率从 29.01% 提高到 52.43%。受控分析进一步确定有效的中心边缘对应和领先的光谱方向作为检索增益的关键来源,证明了潜在多模态知识超越本机相似性得分的效用。代码和模型可在 https://github.com/Luo1Yan/HSA 公开获取。