论文
用于持久且语义一致的对象描述的记忆增强视觉语言代理
Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning
摘要
视觉语言模型(VLM)通常会对不同视点的同一对象产生不一致的描述,从而阻碍了具身智能体随着时间的推移构建一致的语义表示的能力。以前的方法使用离线多视图聚合或多级管道来解决不一致问题,这些管道将探索、数据关联和描述学习解耦,对先前观察到的对象进行推理的能力有限。在本文中,我们介绍了一种统一的、内存增强的视觉语言代理,它在单个自回归框架内同时处理数据关联、对象描述和探索策略。该模型处理当前的 RGB 观察结果、自上而下的探索图以及序列化为对象级标记的对象级情景记忆,确保跨扩展序列的持久对象身份和语义一致性。为了以自我监督的方式训练模型,我们使用基于分歧的策略和伪描述模型在真实的 3D 环境中收集数据集,该模型强制跨多视图描述历史的一致性。对手动注释的对象级测试集进行的广泛评估表明,与基线模型相比,标准描述得分提高了 11.86%,描述自相似性提高了 7.39%,同时通过紧凑的场景表示实现了可扩展的性能。代码、模型权重和数据可在 https://hsp-iit.github.io/epos-vlm/ 获取。