论文

EmbodiedLGR:集成轻量级图表示和检索以实现机器人代理中的语义空间记忆

EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents

上下文与知识记忆Agent记忆

摘要

随着应用于机器人技术的代理人工智能世界的发展,对能够有效构建和检索记忆和观察的代理的需求不断增加。在复杂环境中运行的机器人必须构建记忆结构,以便通过利用当前操作上下文的助记符表示来实现有用的人机交互。与机器人交互的人们可能期望实体代理提供有关位置、事件或物体的信息,这要求代理在类似人类的推理时间内提供精确的答案,才能被视为有响应。我们提出了嵌入光图检索代理(EmbodiedLGR-Agent),这是一种视觉语言模型(VLM)驱动的代理架构,可以构建机器人操作环境的密集且高效的表示。 EmbodiedLGR-Agent 通过提供基于参数高效 VLM 的混合建筑检索方法,直接满足对环境的高效记忆表示的需求,该方法存储有关对象及其在语义图中的位置的底层信息,同时使用传统的检索增强架构保留观察场景的高级描述。 EmbodiedLGR-Agent 在流行的 NaVQA 数据集上进行评估,在体现代理的推理和查询时间方面实现了最先进的性能,同时相对于当前最先进的方法在全局任务上保持了有竞争力的准确性。此外,EmbodiedLGR-Agent 已成功部署在物理机器人上,通过人机交互在现实环境中显示出实用性,同时在本地运行视觉语言模型和构建检索管道。