论文
维特根斯坦式表示假说:语言是多模态收敛的吸引子吗?
The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?
摘要
理解为什么来自不同模态的独立训练的神经网络会趋向于共享表征,以及这种趋同会导致什么结果,仍然是表征学习中的一个悬而未决的问题。所有现有证据都依赖于对称相似性度量,它可以检测收敛性,但在结构上对其方向视而不见。我们引入了使用循环 kNN 的定向收敛分析,这是一种非对称对齐度量,应用于跨越点云、视觉和语言的数十个独立训练的单峰模型。我们发现了一致的方向不对称性:非语言模态向语言邻域结构的移动明显多于相反,并且这种模式适用于所有模型族和尺度,但对于对称测量来说是完全不可见的。机制分析追踪特征密度不对称的方向性,从而语言表示占据表示空间最紧凑的区域。信息瓶颈框架提供了一个原则性的解释:压缩下的优化驱动表示朝着语言的离散、组合结构特征发展。我们将其形式化为维特根斯坦表示假说:语言的语义结构是多模态表示收敛的渐近吸引子。
