论文
可渲染程序的多模式思维
Multimodal Thinking with Renderable Programs
摘要
当前的视觉语言模型(VLM)擅长视觉内容理解和基于文本的推理,但其结构限制了将图像纳入推理链的进步。尽管全模态模型在统一文本和图像生成方面做出了努力,但它们专注于开放域中的视觉任务,由于图像的光栅化或潜在表示而缺乏易处理性。我们引入了 SVGLM,这是一个使用可扩展矢量图形 (SVG) 原语在推理任务中连接文本和图像的框架。我们利用 SVG 的二元性作为图像描述和文本指令,产生更紧凑、可解释的解决方案,使通用 VLM 具备在推理过程中生成图像的能力。我们提供基于 SVG 的图像编辑数据集的大型精选数据集,以及调整开源 VLM 的范例。数学推理基准实验表明,SVGLM 具有强大的 SVG 生成能力以及图像思考智能。我们的结果强调 SVG 作为构建更强大的数字域代理的合适媒介,弥合了基于文本的思维和基于像素的图像之间的差距。