论文

大视觉语言模型中认知专家的混合

Mixture of Cognitive Experts in Large Vision-Language Models

模型推理推理策略与问题分解

摘要

大视觉语言模型 (LVLM) 需要对视觉和文本输入进行强有力的推理。最近的研究表明,认知元素,尤其是多样化的表征和元认知,与更好的表现相关。许多所需的感知功能已经由专门的特定领域计算机视觉模型提供,这些模型充当感知子系统,用于检测对象、定位对象、推断状态、恢复空间布局和阅读文本。关键的挑战是将这些多编码器专家集成到一个值得信赖、可解释和连贯的表示中,从而提高可验证性并减少幻觉。这很困难,因为视觉语言问题跨越不同的认知水平,但大多数 LVLM 管道都应用相同的感知推理路由,而不管每个查询的需求如何。我们提出了一种证据驱动的多模态推理框架,该框架利用布鲁姆启发的分类法作为分层推理协议。两阶段认知语言化首先通过将专家输出分解为简短的原子证据陈述来产生文字证据摘要。然后,它执行布卢姆语言化,将这些证据项转化为阶段性推理轨迹,并且轻量级推理轨迹模块对轨迹进行定量分析,使证据使用和推理进程变得明确。通过这种整合,我们观察到感知和推理能力的一些提高。此外,跟踪模块提供了定量证据,表明不同的查询会导致不同的认知进入水平和证据使用轨迹,从而实现细粒度分析。