论文
PixelUMM:无编码器的统一图像和视频理解和生成
PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
摘要
统一多模态模型(UMM)通常为理解和生成使用不同的视觉表示,这会增加视觉上下文长度,并使其与现有视觉语言预训练流程的集成变得复杂。像素空间建模的近期进展提供了无需编码器的替代方案,但从图像推广到视频并不容易:视频理解与生成采用不同的时间表示,统一视觉接口的设计仍是开放问题。我们提出PixelUMM,一种直接在像素空间统一图像与视频理解和生成的无编码器模型。PixelUMM把图像表示为空间图块、把视频表示为时空管状图块,通过单层线性投影将原始像素连接到共享多模态骨干。其Mixture-of-Transformers架构结合共享注意力和任务特定参数,并将干净像素预测扩展至视频生成,同时支持自回归文本预测与像素空间流匹配。实验表明,PixelUMM在图像和视频理解、生成任务中表现具有竞争力。我们进一步研究解码器设计、时空图块大小等关键选择,为未来像素空间统一多模态模型提供经验依据。