论文

PolarMem:用于可验证多模态代理的免训练极化潜在图存储器

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Multimodal Agents

上下文与知识记忆Agent记忆

摘要

随着多模态代理从被动观察者发展为长期决策者,他们需要的记忆系统不仅提供信息可用性,而且提供逻辑可验证性。当前架构的一个基本限制是概率视觉语言模型和密集联想记忆固有的认知不对称性:它们将语义亲和力与事实存在混为一谈,并且在结构上无法编码负面约束。为此,我们引入了 PolarMem,这是一种免训练的极化潜在图存储器,旨在将代理推理基于可验证的证据。 PolarMem 通过非参数分布划分将模糊感知可能性转换为离散逻辑约束。此外,它采用具有正交抑制连接的极化图拓扑来显式地将经过验证的否定存储为主要认知状态。在推理时,我们强制执行逻辑主导的检索范式,抑制违反负面约束的幻觉模式。对八个冻结的视觉语言模型和六个基准的广泛评估表明,PolarMem 作为一个强大的认知系统发挥作用,为可验证的多模态代理奠定了基础。我们的代码可在 https://github.com/czs-ict/PolarMem 获取。

PolarMem:面向可验证视觉-语言模型的免训练极化潜在图记忆
图2:PolarMem 框架的架构概览。(A) 双通路逻辑构建(Dual-Pathway Logic Construction):视觉通路(m_I)采用集成语义一致性验证与自适应分布划分,将候选概念归类为 Positive、Negative 与 Uncertain 状态。文本通路(m_T)提取语义实体以建立确定性对齐边。(B) 极化图记忆(𝒢_polar):一种异构拓扑,通过正交的 ℰ_NOT_HAS 边显式编码负面知识,将模糊的感知可能性转化为可验证的逻辑约束。(C) 检索与校准推理(Retrieval and Calibrated Inference):一种字典序的、逻辑感知的检索协议将逻辑一致性置于语义相似性之上,确保约束的主导地位。经逻辑净化的证据被序列化为多模态上下文,使冻结的 VLM 主干能够基于可验证记忆而非易产生幻觉的参数化先验生成响应。