论文

面向类人推理的信念感知VLM模型

Belief-Aware VLM Model for Human-like Reasoning

上下文与知识记忆Agent记忆

摘要

用于意图推断的传统神经网络模型严重依赖可观测状态,难以在多样任务和动态环境中泛化。视觉语言模型(Vision Language Models, VLMs)与视觉-语言-动作(Vision Language Action, VLA)模型的最新进展通过大规模多模态预训练引入了常识推理,实现了跨任务的零样本性能。然而,这些模型仍然缺乏表示与更新信念的显式机制,限制了它们进行类人推理或捕捉长时程中不断演化的人类意图的能力。为解决这一问题,我们提出一个融合基于检索的记忆与强化学习的信念感知VLM框架。我们没有学习显式的信念模型,而是使用基于向量的记忆来近似信念,该记忆检索相关的多模态上下文,并将其纳入VLM进行推理。我们进一步利用作用在VLM潜在空间上的强化学习策略来改进决策。我们在HD-EPIC等公开的VQA数据集上评估了我们的方法,展示了相对零样本基线的一致改进,凸显了信念感知推理的重要性。

面向类人推理的信念感知VLM模型:论文配图
图 1:所提出的信念感知 VLM 的架构。 (a) 视觉语言输入对场景和查询上下文进行编码。 (b) 基于检索的信念模块,从过去的记忆中形成信念上下文。 (c) VLM πθ\pi_{\theta} 融合多模态和置信标记以产生潜在表示。 (d) 政策网络通过强化学习完善行动。