论文
自我预言解码解锁 LVLM 中的视觉搜索
Self-Prophetic Decoding to Unlock Visual Search in LVLMs
摘要
大型视觉语言模型(LVLM)正在迅速向真正的多模态推理发展,视觉搜索代表了图像思维范式的具体实例。然而,LVLM 视觉搜索面临两个关键挑战:后训练 之后内在功能之间的不兼容,以及长多步推理上下文中的干扰。为了解决这些问题,我们提出了两个新颖的见解。首先,预 LVLM 和 后训练 LVLM 之间的自我调节利用 预训练 模型固有的单步功能来减轻能力恶化和长上下文干扰。其次,基于概率的预言采样取代了朴素的提示,提供了一个概率接口,其中 预训练 模型充当预言家,而 后训练 模型在其输出分布下选择性地接受预言标记,从而保留连贯的多步骤推理。基于这些见解,我们引入了 SeProD,这是一种自我预言解码框架,它利用固有的单步功能,以 无需训练 即插即用的方式实现连贯的多步推理。实验表明,SeProD 凭借其并行预言接受机制,在 4 个视觉搜索基准的所有 12 个分区以及通用 VQA 基准上一致改进了多个视觉搜索 LVLM,而无需增加计算开销。