论文
Timage:微调 视觉语言模型的生成图像文本范式
Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
摘要
多模态 大语言模型 (MLLM) 在细粒度空间推理过程中经常会丢失正确的图像区域,因为文本查询很少将任何显式几何锚点带入像素域。流行的补救措施要么重新连接模型的权重,要么用冗长的指令填充提示,但这两种方法都无法在不削弱骨干网整体能力的情况下可靠地将语言固定到正确的视觉坐标。我们引入了 Timage,一种将多模态理解重新定义为在输入处解决的对齐问题的范例:查询作为排版覆盖图绘制到图像本身上。该叠加层的放置和外观由约束薛定谔桥 (cSB) 生成,这是一种熵最优传输采样器,可将布局综合分解为两个耦合的随机阶段。第一阶段,区域搜索,将噪声传输到与查询对齐的图像区域,同时遵守保护显着前景内容的硬遮挡屏障;第二阶段,外观塑造,通过“墨水预算”正则化器调整字形的大小,以便渲染的文本保持清晰和视觉平衡。生成的叠加层充当显式注意力信标,沿着空间语义引导模型的焦点。在 VMCBench 套件上,Timage 与适度的 7B 主干配合使用,明显超越了更大的专有系统以及参数调整的基线。该研究将有意的输入重建定位为加强多模态推理的强大的、架构中立的杠杆。