论文
即时场景图增长:对抗长视野机器人中的感知饱和
Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics
摘要
虽然 3D 场景图 (3DSG) 为实体代理提供了关键的结构化表示,但传统的提前“构建一切然后过滤”管道与边缘平台的实时、低延迟需求相冲突,通过严重的观察冗余引发感知饱和效应。为了解决这个问题,我们提出了 JITOMA(即时按需记忆激活),这是一个闭环框架,它将任务推理、感知和记忆统一到一个即时增长过程中。 JITOMA 没有详尽地绘制整个环境,而是在前端利用自上而下的任务热图来过滤连续观察,路由最小流以维护低成本、休眠锚点的全局基础。根据认知查询,后端 大语言模型 (LLM) 解析机器人意图以动态唤醒与任务相关的锚点,从而触发昂贵的语义操作,例如仅在激活的本地子图中进行密集节点字幕。为了评估这些动态能力并研究感知饱和度权衡,我们引入了 JITOMA-Bench,它是长视野任务切换和复杂意图基础的基准。在 JITOMA-Bench 中,JITOMA 在所有层中仅维护 1--6 个活动语义对象和 0.25--0.28 秒/帧,这表明语义计算仍然受当前任务需求的限制,而不是累积的场景复杂性。