论文
Key-Gram:用于具体操作的可扩展世界知识
Key-Gram: Extensible World Knowledge for Embodied Manipulation
摘要
具身控制越来越需要模型遵循组合语言指令,同时对动态视觉状态进行推理。然而,当前的视觉-语言-动作策略和世界-动作模型通常将语言知识与视觉计算结合在共享主干或调节路径中,导致模态竞争并使知识扩展依赖于主干更新。在本文中,我们介绍了 Key-Gram,这是一种条件记忆框架,它将语言衍生的世界知识与具体控制的视觉状态推理分开。其核心是一个内存模块,它将指令分解为特定于任务的关键语法,通过确定性哈希查找检索静态语言先验,并通过上下文感知门控和轻量级卷积融合将检索到的条目注入到选定的隐藏层中。这种设计允许主干将其主要能力投入到视觉推理和动作推理,而可重用的指令知识则存储在可扩展的外部存储器中。逻辑内存表可以在训练期间方便地进行分区,并且由于其 $O(1)$ 查找模式,可以在推理期间有效地放置在主机内存上。在 RoboTwin2.0、LIBERO/LIBERO-Plus 和现实世界的双臂操作中,Key-Gram 持续改进 $π_{0}$ 和 $π_{0.5}$ 主干网,在 RoboTwin2.0 上平均相对收益为 $29.5\%/9.9\%$,在没有目标域的 LIBERO-Plus 传输上平均相对收益为 $35.8\%/4.5\%$ 微调,以及现实世界长期任务的 $15.4\%/8.1\%$。这些结果表明,外化语言记忆为改善构图基础、迁移和现实世界操作提供了有效且可扩展的机制。