论文

Aphanta:诊断任务对齐的图像编辑中间体以进行多模态推理

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

模型评测评测方法与指标

摘要

显式视觉中间体可以帮助多模态 大语言模型 (MLLM) 外部化空间证据和更新的视觉状态,但它们的效用取决于图像编辑器是否能够忠实地实现所需的转换。我们引入了 \textbf{Aphanta},这是一个用于 MLLM -> 图像编辑器 -> MLLM 管道的自动任务发现和闭环诊断框架。 Aphanta 评估三个条件——直接推理、使用编辑器生成的中间体进行推理以及使用理想化的参考中间体进行推理——以将潜在的视觉空间与当前编辑器的实际效用分开。在 20 个候选任务和多个编辑器-MLLM 组合中,我们发现效用具有很强的任务条件性。收益集中在视觉线索注入、基础和反事实状态实现上,而需要符号敏感构造或结构外推的中间体的可靠性则大大降低。在选定的正任务子集上,我们的综合 Qwen 流程将平均任务得分从 0.343 提高到 0.445($+10.2$ 点;$+29.7\%$ 相对),而完整的研究还保留了过滤和不成功的任务以暴露边界。这些结果将图像编辑定位为专门的视觉工作空间而不是通用推理机制,并将 Aphanta 建立为用于测量任务表示对齐、编辑器实现和下游管道实用程序的可重用协议。