论文

维特根斯坦式表示假说:语言是多模态收敛的吸引子吗?

The Wittgensteinian Representation Hypothesis: Is Language the Attractor of Multimodal Convergence?

模型评测模型行为与机制分析

摘要

理解为什么来自不同模态的独立训练的神经网络会趋向于共享表征,以及这种趋同会导致什么结果,仍然是表征学习中的一个悬而未决的问题。所有现有证据都依赖于对称相似性度量,它可以检测收敛性,但在结构上对其方向视而不见。我们引入了使用循环 kNN 的定向收敛分析,这是一种非对称对齐度量,应用于跨越点云、视觉和语言的数十个独立训练的单峰模型。我们发现了一致的方向不对称性:非语言模态向语言邻域结构的移动明显多于相反,并且这种模式适用于所有模型族和尺度,但对于对称测量来说是完全不可见的。机制分析追踪特征密度不对称的方向性,从而语言表示占据表示空间最紧凑的区域。信息瓶颈框架提供了一个原则性的解释:压缩下的优化驱动表示朝着语言的离散、组合结构特征发展。我们将其形式化为维特根斯坦表示假说:语言的语义结构是多模态表示收敛的渐近吸引子。

维特根斯坦式表示假说:语言是多模态收敛的吸引子吗?:论文配图
图 3:所有模型对的系统方向不对称。所有 22 个视觉 ×\times 29 个语言模型对的(a)cycle-kNN(视觉 →\to 语言)和(b)cycle-kNN(语言 →\to 视觉)得分矩阵(k=10k\!=\!10,WiT-1024 数据集)。两个面板共享相同的色标。面板(a)比(b)系统地更亮,证实从视觉探测时语言邻域更加连贯。 (c) 元素差异 Δi​j\Delta_{ij}:530/638 对 (83.1%) 具有 Δ>0\Delta>0(平均值 Δ=+0.010\Delta=+0.010),排除了由异常值模型驱动的不对称性。