论文
ETCHR:编辑以澄清和利用推理
ETCHR: Editing To Clarify and Harness Reasoning
摘要
多模态 大语言模型 具有先进的视觉推理能力,但纯文本的思维链仍然是需要细粒度焦点或视图转换的问题的瓶颈。 “用图像思考”范式缩小了这一差距,但现有方法要么受到固定的预定义工具包的限制,要么从统一的多模态方法产生噪声中间图像。我们追求第三种选择:使用专用的图像编辑模型并将其与理解模型解耦。然而,现成的图像编辑器作为推理助手失败了,有两个互补的差距:语言方面的差距,作为被动指令跟随者训练的编辑无法将抽象问题映射到适当的视觉转换,以及生成方面的差距,其中编辑正确性随着推理深度的增长而降低。在此分析的指导下,我们引入了 ETCHR(编辑澄清和利用推理),这是一种与下游理解模型解耦的问题条件推理感知图像编辑器,并针对两个差距使用两阶段配方进行训练:通过编辑轨迹上的监督 微调 进行推理模仿,然后使用 VLM 派生的奖励进行推理增强,以实现编辑正确性和下游推理准确性。由于编辑器是解耦的,ETCHR 以 无需训练 方式插入不同的开源和闭源 MLLM。在五个任务系列(细粒度感知、图表理解、逻辑推理、拼图恢复和 3D 理解)中,ETCHR 将 Qwen3-VL-8B 的平均 Pass@1 从 55.95 提高到 60.77 (+4.82),使用 Gemini-3.1-Flash-Lite 从 65.08 提高到 70.55 (+5.47),使用 Gemini-3.1-Flash-Lite 从 76.55 提高到 76.55 1T 参数 MoE 型号 Kimi K2.5 为 81.16 (+4.61)。