论文

MLLM 的更像单词的图像标记化

A More Word-like Image Tokenization for MLLMs

上下文与知识上下文工程

摘要

现代多模态 大语言模型 (MLLM) 通常保持语言模型固定,并训练视觉投影仪,将像素映射到其嵌入空间中的标记序列,以便图像可以以与文本基本相同的形式呈现。然而,语言模型已经过优化,可以在离散的、语义上有意义的标记上运行,而流行的视觉投影仪将图像转换为一长串连续且高度相关的嵌入。这导致视觉标记的行为与 LLM 最初训练理解的类似单词的单元不同。我们提出了一种新颖的解缠结视觉标记化(DiVT),它将补丁嵌入聚集成连贯的语义单元,因此每个标记对应于一个不同的视觉概念,而不是一个严格的网格单元。 DiVT 进一步调整其 词元预算 以适应图像复杂性,提供明确的精度计算权衡,既不修改视觉编码器也不修改语言模型。在不同的多模式基准测试中,DiVT 以显着更少的视觉标记匹配或超越基线,在有限的 词元预算 下展示了鲁棒性,显着降低了内存成本和延迟,同时使视觉输入与 LLM 更加兼容。我们的代码可在 https://github.com/snuviplab/DiVT 获取。