论文
用工具思考,而不是用像素:工具调用作为视觉推理的文本支架
Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning
摘要
工具增强的视觉语言模型越来越多地“用图像思考”:它们调用裁剪、缩放或编码工具并对返回的像素进行推理。然而,最近使用盲测、增益分解和注意力分析的工作表明,返回的图像贡献很小,这就提出了一个问题:如果像素不携带增益,那么什么可以呢?我们假设承载信号是在任何返回的像素到达之前发出的结构化文本:工具名称、坐标、目标描述和意图。这个文本支架编码了要查找的位置和要查找的内容。我们引入 TextCall (call-but-no-return) 来测试这一点:它保留脚手架,但用文本占位符替换返回的图像 [图像输出已跳过]。三项研究支持这一假设。 (i) 不需要返回像素:在 LoRA、完整的 微调 和 RL 中,TextCall 匹配或超过完整的图像思维;在强化学习下,它会在报告的检查点保留工具的使用,避免出现故障模式,在匹配的设置下,看到返回的图像会导致模型停止调用工具并直接回答。 (ii) 支架的充分性:在匹配的训练查询上,仅支架输入产生与返回图像输入相同的准确性。 (iii) 组件特异性:将支架分解为推理文本和空间代码,显示两个组件都有贡献,其中占主导地位的组件因任务而异。这些结果共同支持了工具调用支架假设:在当前的图像思维分布中,活动信号是工具调用时发出的结构化文本;返回的图像是冗余的载体。 TextCall 保留了准确性,同时将延迟减少了 29-46%,并消除了工具执行 API 调用。我们的主张适用于当前的图像思维基准;构建像素真正承载的任务仍然是一个开放的方向。