论文
按需观察:多模态推理中视觉证据获取的认知调度框架
Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
摘要
现有多模态推理方法主要遵循两种范式:在推理前将视觉输入转换为文本,或在统一的视觉-语言表示空间内进行端到端推理。尽管取得了经验性进展,两种范式都存在根本性的结构局限。前者依赖静态的视觉到文本转换,容易压缩并丢失细粒度视觉细节。后者容易受到联合优化与注意力机制引发的语言主导影响,导致推理过程中对视觉证据的忠实性被系统性削弱。在本工作中,我们论证一个核心挑战是视觉证据以何种方式、在何时被引入推理过程。基于这一洞见,我们提出CSMR——一个多模态推理框架,其中语言模型通过决定何时调用独立的视觉感知模块来获取与任务相关的视觉证据,从而控制推理过程。在多个多模态推理基准上的实验表明,CSMR在零样本设置下准确率始终优于代表性基线方法。进一步的实验分析证实,这些优势主要来自所提出的认知调度机制。
