论文

通过学习代理词元进行忠实的视觉推理

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

应用与实践通用理解与问答

摘要

多模态 大语言模型 (MLLM) 在视觉问答 (VQA) 领域取得了显着的成功,但其“黑匣子”性质阻碍了在关键领域的部署。有视觉依据的推理 (GVR) 方法试图通过明确地将文本原理与视觉定位信息(通常是文本坐标)结合起来来提高可解释性。这种机制缺乏与视觉特征的可学习语义链接,通常会导致语义空间差距,其中模型产生与图像证据不对应的坐标。在这项工作中,我们介绍了 Composer,这是一种 MLLM,它利用基于学习代理词元的新颖视觉基础机制来促进忠实的可解释性。这些离散的符号指针显式地索引图像潜在空间,允许模型将视觉区域作为可寻址、语义可操作的集合进行操作。为了严格验证我们新颖的基础机制,我们构建了 ComposerGCoT,这是一个综合数据集,可以对推理一致性和基础准确性进行整体评估。实验结果表明,Composer 在最终答案精度方面与基于坐标的对应产品达到了同等性能,同时将视觉定位精度提高了 +9.0 分。通过证明离散代理词元比典型的文本坐标更有效地捕获空间语义,我们建立了具有可学习语义链接的视觉基础机制代表了通往值得信赖和可靠的 MLLM 的有希望的道路。