论文

时间序列、视觉与语言:探索对比表征空间中对齐的极限

Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces

模型评测模型行为与机制分析

摘要

Platonic Representation Hypothesis(柏拉图表征假说)认为,在不同模态上训练的模型所学到的表征会收敛到世界的共享潜在结构。然而,该假说大多在视觉与语言中被检验,时间序列是否参与这种收敛仍不清楚。我们首先在三模态设定下检验这一问题,发现在缺乏显式耦合时,独立预训练的时间序列、视觉和语言编码器表现出近乎正交的几何结构。随后,我们通过在冻结编码器上训练投影头并使用对比学习进行事后对齐,并从几何、缩放行为以及对信息密度和输入模态特性的依赖等角度分析所得表征。我们的研究表明,对比表征空间中的整体对齐随模型规模提升而改善,但这种对齐是不对称的:时间序列与视觉表征的对齐强于与文本的对齐,且图像可以作为时间序列与语言之间的有效中介。我们进一步发现,更丰富的文本描述仅在达到某个阈值前改善对齐;在更密集的描述文本上训练并不会带来进一步提升。视觉表征也观察到类似效应。我们的发现为构建涉及视觉与语言之外非传统数据模态的多模态系统提供了参考。

时间序列、视觉与语言:探索对比表征空间中对齐的极限
图4:三模态对比对齐框架。冻结的预训练编码器分别将时间序列、可视化图与文本映射到各自的单模态表示空间。可训练的投影头将这些表示变换到共享嵌入空间。对齐通过在所有模态对(TS–IMG、TS–TXT、IMG–TXT)上联合施加的对称对比目标来学习。