论文
TVI-CoT:用于多模态理解的文本-视觉交错思维链推理
TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding
摘要
事实证明,思维链 (CoT) 推理对于增强 大语言模型 中的问题解决能力非常有效。然而,当应用于多模态 LLM (MLLM) 时,现有的 CoT 方法面临着一个根本性的限制:它们完全在文本中执行推理,而在推理过程中不访问视觉特征。在初始视觉编码之后,图像信息变得不可访问,迫使模型仅根据初始描述中捕获的内容进行推理,这形成了“视觉盲推理”范式,限制了细粒度的视觉提取、错误验证和自适应注意力。我们提出了文本-视觉交错思维链(TVI-CoT),这是一个框架,可以通过可学习的控制标记 <THINK>、<LOOK> 和 <ANSWER> 实现文本推理和视觉特征访问的显式交错。这些标记允许在推理和视觉基础之间动态切换,关注以不断发展的推理状态为条件的相关图像区域。八个基准测试的实验表明,基于 MLLM 的 CoT 方法取得了最先进的结果,并且与基线相比性能显着提升:MMMU 上 +6.1%、MathVerse 上 +3.8%、MathVista 上 +3.4% 和 ScienceQA 上 +3.4%。代码可在 https://github.com/hulianyuyy/TVI-CoT 获取。