论文
InterSketch:具有自我校正视觉草图和逐步奖励的交错推理模型
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
摘要
虽然视觉语言模型(VLM)已经表现出多轮视觉推理能力,但它们的推理轨迹仍然相对较浅,并且以文本为中心的范式占主导地位,限制了它们对复杂视觉挑战的适用性。相比之下,类人思维通常涉及具有交错的视觉文本思维链(VT-CoT)的长视野推理。为了弥补这一差距,我们引入了 InterSketch,这是一种交错推理模型,通过自我纠正和逐步奖励机制来增强 VT-CoT 能力。 InterSketch 使用外部工具动态生成中间视觉草图,并将其与文本推理交织在一起,从而在长视野视觉理解任务中实现有效的感知和逻辑推理。具体来说,在第一个冷启动阶段,我们提出了一个合成的高质量交错 VT-CoT 数据集,并包含反射机制以使模型具有多轮交错推理和自我校正的能力。在随后的强化学习(RL)阶段,我们设计了一种逐步奖励机制,以减轻长期推理的仅限最终监督中固有的奖励信号的稀疏性。视觉推理基准的大量实验证明了 InterSketch 的有效性,甚至优于 Gemini-3-Pro 等专有模型。