论文

多模态比对的 Indra 表示假说

The Indra Representation Hypothesis for Multimodal Alignment

模型评测模型行为与机制分析

摘要

最近的研究发现了一个有趣的现象:单峰基础模型倾向于学习收敛表示,而不管架构、训练目标或数据模式的差异。然而,这些表示本质上是样本的内部抽象,独立地表征样本,导致表达能力有限。在本文中,受因陀罗网哲学隐喻的启发,我们提出了因陀罗表征假说。我们认为,单峰基础模型的表示正在收敛,隐含地反映了现实背后的共享关系结构,类似于因陀罗网络的关系本体。我们使用范畴论中的 V 丰富的 Yoneda 嵌入来形式化这一假设,将 Indra 表示定义为每个样本相对于其他样本的关系概况。该公式在给定成本函数下被证明是唯一的、完整的且结构保持的。我们使用角距离实例化 Indra 表示,并在涉及视觉、语言和音频的跨模型和跨模式场景中对其进行评估。大量实验表明,Indra 表示持续增强跨架构和模态的鲁棒性和对齐,为单峰基础模型的 无需训练 对齐提供理论基础和实用框架。我们的代码可在 https://github.com/Jianglin954/Indra 获取。