论文

思想标记的混合:统一自由形式多模态基础的感知和推理

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

模型推理推理策略与问题分解

摘要

多模态 大语言模型 在视觉定位任务方面取得了巨大进展,但现有方法仍然难以统一精确定位和复杂推理。一方面,基于文本的方法依赖于坐标或索引预测,严重限制了模型对密集视觉对象的感知能力。同时,基于潜在标记的方法使用没有固有空间参考的特殊标记,并使用缺乏思维步骤的解码机制,削弱了高级推理能力。因此,开发一个在感知和推理方面都表现出色的统一框架仍然具有挑战性。为了解决这个问题,我们提出了 Mixture-of-Thought-Tokens (Motto),这是一种新的自由形式多模态基础方法,可以弥合感知推理差距,使 MLLM 能够支持多样化、任意定位查询。具体来说,我们引入了空间视觉定位思维词元化,以明确地将特殊标记与空间位置对齐,以获得清晰的空间对应性和视觉可解释性。我们进一步设计了一个上下文自适应词元链,它可以在交错推理链中动态切换视觉定位模式,从而在不同复杂性的任务中实现稳健的视觉定位。此外,我们构建了 PR-Bench,一个新的指称表达理解基准来评估感知推理差距。大量实验表明,Motto 在各种自由形式视觉定位任务中均实现了最先进的性能。