论文
t-gems:用于减少剪辑图像编码器的文本引导退出模块
t-gems: text-guided exit modules for decreasing clip image encoder
摘要
多模态深度神经网络通过整合不同的数据模态来增强深度理解。来自不同模态的数据通常被投影到共享的潜在空间中以进行相似性计算,但由于大型图像编码器和预测期间测试数据的平等处理,该过程是资源密集型的。早期退出方法通过利用中间层来减少计算负载,从而节省时间和内存。然而,对于图像文本对等多模态数据,开发此类方法具有挑战性。本研究研究了编码器中间层(例如 CLIP)中存在的语义内容分布,这些分布可以从文本描述中得出。我们引入文本引导退出模块(T-GEM)和基于速率的正则化器来控制编码器使用成本,同时保持跨模式理解性能。