论文
V-ABS:用于动态视觉推理的动作观察者驱动光束搜索
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
摘要
多模态 大语言模型 (MLLM) 在一般感知方面取得了显着的成功,但复杂的多步骤视觉推理仍然是一个持续的挑战。尽管最近的代理方法结合了工具的使用,但它们经常忽略关键的执行反馈。因此,他们遭受了想象-行动-观察者(IAO)偏见,即先前的想象和观察者反馈之间的不一致,从而破坏了推理的稳定性和最优性。为了弥补这一差距,我们引入了 V-ABS,这是一种行动观察者驱动的波束搜索框架,可以通过思考者-行动者-观察者迭代进行深思熟虑的推理。我们还提出了一种基于熵的自适应加权算法,通过动态平衡策略先验和观察反馈之间的置信度分数来减轻 IAO 偏差。此外,我们构建了一个包含超过 80k 个样本的大规模监督 微调 (SFT) 数据集,以指导模型为正确的行动路径分配更高的先验置信度。跨越八个不同基准的大量实验表明,V-ABS 实现了最先进的性能,在 Qwen3-VL-8B 基准上平均提高了 19.7%,并且在开源和专有模型上都获得了一致的增益。