论文

带图像推理的自进化代码

Self-Evolving Code-with-Image Reasoning

上下文与知识记忆Agent记忆

摘要

在解决视觉任务(裁剪、缩放、旋转、提亮)时,多模态模型越来越多地使用工具,这种范式被称为图像思维。核心挑战之一是感知:工具主要用于暴露视觉证据,对证据的推理保留在语言中,而大多数目标原则上是人类可以通过检查确定的。然而,一些视觉问题并不受到感知的瓶颈:恢复它们的答案需要对像素执行多步视觉算法。在此类问题上,模型通常会立即说出正确的算法,但仍然会回答错误,因为语言可以描述一种算法,但无法运行该算法。 Code-with-Image 跨越了这条线:除了 Python 解释器之外,模型必须在代码中实现真正的视觉算法来解决任务;程序本身成为推理。然后,瓶颈从执行代码转移到决定实施哪种算法。因此,我们让模型自学:无需训练 反射循环研究其自己的失败程序,针对建设性 真值 测试修复,并保留作为可移植技能而幸存的内容。在我们的 Code-with-Image Bench (CwI-Bench) 上,通过隐藏的视觉计算和不相交的学习和评估分割诱导了 30 个任务族,即使是 GPT-5.6-luna 也能在无工具的思路下保持在 30% 以下;给定一个裸解释器,它可以达到 43%,而通过其自身的可执行反射发展技能,则可以达到 67%。开放式 27B 模型攀登相同的阶梯(9% $\rightarrow$ 33% $\rightarrow$ 56%),并且技能是纯文本的,可以跨规模和家庭转移。当代码带有推理时,调试代码就变成了调试推理。