论文
超越情景评估:顺序体现问答中的记忆架构瓶颈
Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering
摘要
传统上,实体问答(EQA)是在情景公式下进行评估的,其中代理独立地解决每个任务并在情景之间重置内部状态。然而,现实世界的机器人会持续运行,必须积累、保留和有选择地重用从先前交互中获得的信息。尽管存在这一实际需求,但 EQA 中支持顺序内存所需的架构机制仍未得到充分探索。在这项工作中,我们研究了当 EQA 代理按顺序评估时,不同的内存架构如何表现,在同一场景中回答多个问题,同时跨查询传递内存。我们发现仅仅保留现有的记忆通常是不够的。仅保留可遍历性信息(例如 2D 占用地图)的智能体会记住机器人探索过的位置,但不会记住后续问题所需的视觉语义证据。在短视野情景数据上训练的智能体面临着不同的挑战:当暴露于连续的多查询历史时,它们继承的上下文会遭受严重的时间不匹配,而不是形成可重用的场景表示。为了克服这一架构瓶颈,我们强调了结构化、空间基础记忆的必要性:将持久视觉观察映射到度量 3D 几何上的架构可以在连贯的场景表示中保留视觉语义证据。在模拟环境中进行的大量实验表明,这种形式的记忆打破了顺序设置中的准确性与效率的权衡,同时实现了更高的答案准确性和更低的导航成本。我们在现实世界的移动机器人上进一步验证了这些发现,证明与空间位置对齐的视觉记忆对于在物理环境中实现连续、智能操作至关重要。