论文
LAYERSCOPE:视频和多模态学习表示的分层表征
LAYERSCOPE: A Layerwise Characterization of Video and Multimodal Learned Representations
摘要
我们提出了 LAYERSCOPE,这是一种无标签的分层框架,旨在表征模型在视频和多模态设置中学习到的表示。使用最终层或中间层的表示来评估下游性能通常需要大量标记数据、重复的特定于任务的评估和大量计算。为了解决这些限制,LAYERSCOPE 使用局部、全局、分布和基于对应的几何度量来比较模型内部和模型之间的分层表示结构,而不需要特定于任务的标签。我们评估了来自 MVEB/MVEB+ 的视频和多模态分类、聚类以及文本到视频检索任务的七个架构不同的模型。我们发现中间层表示可以优于最终层和模型默认输出。我们还发现没有单一的几何指标能够一致地预测下游性能,但请注意,模型系列中出现了不同的分层几何特征。 LID 显示了任务依赖与性能的关系,而 RankMe 提供了最强的分类和聚类度量,但不是通用的层选择器。我们还发现,配对感知指标比单独的分布距离更好地解释检索。因此,LAYERSCOPE 提供了一个用于比较模型和层之间的表示的框架,从而能够在视频和多模式设置中进行更系统的评估。