论文

Gen-VCoT:通过基于扩散的 RGB 中间表示进行生成视觉思维链推理

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

模型推理推理策略与问题分解

摘要

多模态 大语言模型 (MLLM) 擅长视觉推理,但依赖基于文本的思维链 (CoT),缺乏可解释的视觉中间体。现有方法使用不透明词元或外部工具,缺少关键属性。我们提出了 Gen-VCoT,一个使用专家视觉模型生成 RGB 图像作为推理中间体的框架。它分为三个阶段:视觉定位(SAM 分割)、几何推理(Marigold 深度图)和语义推理(Qwen2-VL 集成)。自适应路由器选择推理深度。评估显示 Gen-VCoT 改善了空间(更好 25%)和深度(更好 50%)问题,但可能会损害简单的事实查询。文本 CoT 在 CLEVR 上的表现优于视觉中间体(91.2% vs 62.5%),显示出任务相关的最佳表示。 Gen-VCoT 为可解释的多模态推理建立了新的范式。