论文
不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理
Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs
摘要
多模态语言模型 (MLLM) 越来越多地与视觉工具(例如深度、流程、对应)配合使用,以增强视觉推理。然而,尽管可以使用这些工具生成的视觉提示,MLLM 通常无法从中受益。现有方法通常将原始工具输出输入到模型中,但这些密集的像素级表示与 LLM 的语言原生推理优势不一致,导致感知较弱并依赖于语言先验。我们认为,在视觉工具可以提供必要的视觉提示的问题中,瓶颈不是更多的工具调用或更大的 MLLM,而是工具输出的表示方式。我们引入了感知程序 (P$^2$),这是一种与模型无关的 无需训练 方法,它将工具输出重写为紧凑的、结构化的、语言本机的摘要,以便 MLLM 可以直接解析和推理。在 BLINK 中的六个以感知为中心的任务中,P$^2$ 始终比基本模型和原始工具增强基线产生了巨大的改进。以 GPT-5 Mini 为基础模型,P$^2$ 的多视图推理准确率从 41.35\% 提高到 86.47\%,相对深度从 52.42\% 提高到 81.45\%,跨任务平均增益达到 22\%,创下了新的最先进结果。即使在较小的 MLLM 上,例如 InternVL3.5-4B 和 Qwen3VL-4B,我们也观察到 P$^2$ 的绝对增益为 15-40%,超过了先前的代理、监督和基于 RL 的工具使用方法——无需任何训练或模型修改。