论文

HYDRA-X:具有整体视觉标记器的原生统一多模式模型

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

模型架构新型架构

摘要

整体视觉分词器是统一多模态模型 (UMM) 的基础,因为它们将不同的视觉输入映射到统一的表示空间中。在本文中,我们提出了 HYDRA-X,这是第一个在单个 Vision Transformer (ViT) 中统一图像和视频标记化的 UMM。我们的设计由两个核心挑战驱动:有效地将时空重建能力注入原生 ViT,并将图像和视频级语义感知嵌入到潜在空间中。为了解决第一个问题,综合消融揭示了两个关键发现:(1)帧级因果时间注意力足以进行视觉重建,而完全时空注意力会降低视觉重建能力; (2)分层时间压缩大大优于单步替代方案。为了解决第二个问题,我们提出了一种轻量级解压缩器,可以在图像-视频教师联合监督下对时间压缩的特征进行上采样,从而在紧凑的潜在空间内强制执行互补的语义结构。在此整体分词器的基础上,我们进一步提出了编辑流程的原则性改进:源-目标交互应发生在分词器内的潜在级别,而不是 LLM 内的语义级别,从而显着提高编辑一致性并加速收敛。 HYDRA-X 在 7B 密集模型上实例化,在图像和视频理解和生成任务中实现了强大的性能,为未来的统一标记器 UMM 铺平了道路。