论文
当提示变成像素:多模态推理中的提示区域定位
When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning
摘要
多模态大语言模型在任务本身以像素形式写成的情况下,越来越多地处理截图和文档。然而,基准测试通常将问题放在文本中,不清楚模型是否在所有通道上使用相同的指令同样好。我们引入可视化任务语义(VTS),这是一种控制干预,使问题进入图像,而源问题和答案保持不变。在六种MLLMs和四种基准测试中,所有24对模型-任务对的准确性平均下降17.8分。模型通常正确地转录视觉问题,但未能使用它,暴露了OCR之外的语义通道差距。为减少这一差距,我们提出了prompt-region定位,其核心设计将问题区域与类型化的语义对齐,并从掩码视图中恢复其清晰表示。在匹配训练成本的情况下,我们的方法将四个基准测试中的VTS准确性从58.0提高到66.3,同时保留原始界面的准确性,且无需OCR或区域元数据。带有阅读任务文本并将其作为推理指令进行定位是两种不同的能力。
