论文

Giraffe:从隐藏文本表示到视觉嵌入的映射架构,用于高效图形设计

Giraffe: A Mapping Architecture from Hidden Text Representations to Visual Embeddings for Efficient Graphic Design

模型架构新型架构

摘要

多模态大语言模型(MLLM)在理解和解释多媒体内容方面取得了显著进展。然而,它们生成媒体的能力仍然有限。最近的方法试图通过将token序列的隐藏表示转换到视觉模型的嵌入空间、或直接转换到原始图像数据来弥合这一差距。然而,这些方法通常使用多个专门token来表示每张图像,这显著增加了输入长度。这对诸如图形设计生成之类的任务成为一个主要限制,因为其输出通常涉及文本、多张图像和布局信息之间数千个token的无缝混合。为应对这一挑战,我们提出一种新架构,使用每张图像单个[IMG] token将隐藏token表示映射到视觉模型(如CLIP ViT-L/14)的嵌入空间。该架构采用两个浅层MLP块,每个块有单独的压缩模块,后接共享的扩展模块,并用六种不同的损失函数训练。一个块在训练期间辅助另一个块,并在推理时被省略,形成轻量级解决方案。该架构在图像到设计和文本到设计生成任务中都展现出强劲性能。

Giraffe:从隐藏文本表示到视觉嵌入的映射架构,用于高效图形设计:论文配图
图 1:所提出的架构的示例结果。该模型根据文本或图像输入生成视觉连贯且风格一致的图形设计。