论文

迈向具有不完整多模态输入的统一视觉语言模型

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

模型训练预训练

摘要

视频语言模型 (VLM) 在不同的计算机视觉应用中展示了令人印象深刻的多模式推理能力。然而,这些 VLM 是特定于任务的,并且假设视频和语言输入都是完整的。然而,现实世界的 VLM 应用程序可能会因传感器停用(例如,由于数据隐私而无法使用摄像头)而面临挑战,产生模态不完整的数据并导致训练和测试数据之间的不一致。虽然直接的不完整输入可以夸耀训练泛化能力并导致训练失败,但其对 VLM 的安全性和可信度方面的潜在风险在很大程度上被忽视了。为此,我们首次尝试提出一种统一的不完整视频语言模型来处理不完整的多模态输入。大量的实验结果表明,我们的方法可以作为先前作品的即插即用模块,以提高其在各种多模式任务中的性能。