论文

CodeBind:使用统一组合码本进行多模态对齐的解耦表示学习

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

模型训练预训练

摘要

多模态表示对齐对于 大语言模型 和机器人技术至关重要。传统方法常常受到跨模态信息差异和数据稀缺的阻碍,导致次优的对齐空间忽略了模态独特的特征。我们提出了 CodeBind,这是一个通过模态共享特定码本设计来优化多模态表示空间的框架。通过逐步调整目标和桥接模式,CodeBind 无需完全配对数据。与传统的硬对齐不同,CodeBind 将功能分解为共享组件以实现语义一致性,以及特定组件以实现模态独特的细节。该设计采用组合矢量量化方案,其中共享码本弥合了模态间隙,而模态特定码本通过防止主导模态掩盖其他模态来减轻表示偏差。 CodeBind 经过九种模态(文本、图像、视频、音频、深度、热、触觉、3D 点云、EEG)验证,在多模态分类和检索任务中实现了最先进的性能。