论文
PonderPounce:预训练的 MLLM 作为机器人控制的情节上下文引擎
PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control
摘要
多模态 大语言模型 (MLLM) 可以整合长视觉历史并从几个例子中推断行为,但视觉-语言-动作模型很少使用这种能力作为情节记忆。 PONDERPOUNCE 没有使用专门构建的内存模块,而是重用了 MLLM 的本机因果上下文。 PONDER 是一个经过预训练的 System 2 MLLM,它集成了事件历史和演示以产生连续的认知。 POUNCE 是一个系统 1 动作模型,异步条件控制最新的认知及其年龄。两者都是端到端联合训练,无需单独的桥预训练。 H100 上优化的每次调用推理可实现仅认知刷新的 p50 延迟为 78 毫秒,动作模型调用的 p50 延迟为 25 毫秒。在 RoboMME 上,PONDERPOUNCE 在基础数据规模上取得了 60.83% 的成功,在 9 倍数据规模上取得了 75.54% 的成功,而 FrameSamp+Modul 的成功率为 44.51% 和 57.88%。在基本规模上,将 PONDER 从 0.8B 扩展到 9B 增加了 6.71 个百分点,而 POUNCE 架构保持不变。没有执行历史的单独训练的 9B PONDER 在匹配监督下仅达到 26.21%。 PONDERPOUNCE 在 RoboCasa-DC 上也取得了 12.5% 的成功,并展示了异步执行下四个任务的实际适用性,平均成功率为 60.98%,而 FrameSamp+Modul 的平均成功率为 40.67%。