论文
视觉工具使用的幻觉:对图像思考进行因果审计
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
摘要
"图像思考"范式为多模态LLMs配备了主动视觉操作,如裁剪和放大。然而,使用这些操作的模型通常在显著更高的token成本下仅实现微小或负面的改进。它们也可能反复裁剪无关区域,并且在直接推理正确回答问题的情况下失败。我们询问返回的视觉证据是否因果地影响答案。为此,我们将视觉工具使用作为因果图来分离观察中介路径与行动诱导捷径。然后通过三个层次进行干预:政策(比较工具使用与直接推理)、轨迹(在rollout期间篡改所有观察)和步骤(在固定前缀下替换一个单独的观察)。我们的步骤级估计量,视觉证据收益,隔离了每个返回的观察贡献。在六种代表性模型和五个精细感知基准测试中,我们揭示了政策偏差,两种失败模式。在无目视检查的情况下,返回的证据对答案没有因果影响。在无计划性检查的情况下,证据是相关的但呼叫调度是不一致的。轨迹级诊断分解了政策级准确性的收益,并显示该收益集中在校准少数群体中。我们称这种差异为视觉工具使用中的幻觉:尽管整体准确性的改进,但在广泛的rollout中,视觉工具使用并不因果地影响答案。代码可在https://github.com/OpenCausaLab/CauAudit处获取。
