论文
回到柏拉图的洞穴:大规模检验跨模式表征收敛
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
摘要
柏拉图表示假说假设,在不同模式(例如文本和图像)上训练的神经网络会趋向于共享现实的表示。如果属实,这对于模态选择是否重要具有重大意义。在本文中,我们表明这一主张的证据比后续研究表明的要弱得多。原始研究中在 1024 个文本-图像对上使用的相互 $k$-最近邻度量仅捕获粗略结构。为了防止对齐在数据扩展时崩溃,$k$ 必须按比例增长,从而削弱了细粒度表示收敛的论点。据报道,最近的模型与语言模型强度的一致性增加已经饱和。此外,一对一的文本-图像配对有利于对齐,而对齐随着非双射数据而减少。我们进一步发现图像和文本表示确实共享粗略的语义结构,但更强的语言模型和更丰富的图像描述都不能产生细粒度的对齐。因此,多模态表示共享粗略结构,而没有收敛到共享表示的证据——可以说,完全表示收敛需要细粒度对齐。