论文

当提示变成像素:多模态推理中的提示区域定位

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

模型训练监督微调与指令调优

摘要

多模态大语言模型在任务本身以像素形式写成的情况下,越来越多地处理截图和文档。然而,基准测试通常将问题放在文本中,不清楚模型是否在所有通道上使用相同的指令同样好。我们引入可视化任务语义(VTS),这是一种控制干预,使问题进入图像,而源问题和答案保持不变。在六种MLLMs和四种基准测试中,所有24对模型-任务对的准确性平均下降17.8分。模型通常正确地转录视觉问题,但未能使用它,暴露了OCR之外的语义通道差距。为减少这一差距,我们提出了prompt-region定位,其核心设计将问题区域与类型化的语义对齐,并从掩码视图中恢复其清晰表示。在匹配训练成本的情况下,我们的方法将四个基准测试中的VTS准确性从58.0提高到66.3,同时保留原始界面的准确性,且无需OCR或区域元数据。带有阅读任务文本并将其作为推理指令进行定位是两种不同的能力。

当提示变成像素:多模态推理中的提示区域定位:论文配图
图 1:任务保持不变,但当问题变成像素时答案会发生变化。 VTS 将问题呈现在图像内,并用固定提示替换本机提示。上面的示意图省略了这个单独的空间提示;下面的示例显示了它。每对中的源视觉证据和目标答案均保持不变。