论文

mEOL:无需训练 用于矢量图形和图像检索的指令引导多模式嵌入器

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

摘要

可扩展矢量图形 (SVG) 既可以用作视觉图像,也可以用作编码丰富的几何和布局信息的结构化代码,但大多数方法都会对它们进行光栅化并丢弃这种符号组织。与此同时,最近的句子嵌入方法产生了强大的文本表示,但不能自然地扩展到视觉或结构化模式。我们提出了一个 无需训练,指令引导的多模态嵌入框架,它使用多模态 大语言模型 (MLLM) 将文本、光栅图像和 SVG 代码映射到对齐的嵌入空间。我们通过特定于模态的指令和结构 SVG 提示来控制嵌入的方向,从而无需学习投影头或对比训练。我们的方法有两个关键组成部分:(1)多模态显式单字限制(mEOL),它指示 MLLM 将任何多模态输入总结为单个标记,其隐藏状态充当紧凑的语义嵌入。 (2) 语义 SVG 重写模块,通过对渲染图像进行视觉推理来分配有意义的标识符并简化嵌套的 SVG 元素,从而暴露隐藏在原始代码中的几何和关系线索。使用重新调整用途的 VGBench,我们构建了第一个文本到 SVG 检索基准,并表明我们的 无需训练 嵌入优于基于编码器和基于训练的多模态基线。这些结果强调提示级控制是结构感知多模态检索参数级训练的有效替代方案。项目页面:https://scene-the-ella.github.io/meol/