论文

尝试一次,然后选择最佳:用于跨情节探索摊销的去冗余过程内存

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

操纵具有隐藏内部状态的物体(例如锁存的微波炉)会迫使机器人在行动之前进行探测。然而,一旦解决了某个实例的机器人,每当再次遇到该实例时,它就会重新运行相同的探测,因为现有的跨情节记忆以任务成功为目标,并围绕状态组织重用,而不是对象或重新探索它的成本。我们提出了面向实例的内存(IOM),一个以对象为中心的框架,它分摊了这种探索:从揭示隐藏状态的单个遭遇中,无论它是否成功,IOM都会记录一个用于操作该实例的简短过程,将其键入对象的可识别特征,并将其作为过程条件策略的软偏置注入。后来的遭遇会认出该物体并回忆起它的过程,而不是重新探索。我们使用现成的视觉语言模型(VLM)实例化这个 蒸馏,该模型将每次遇到的情况解析为过程,而无需进行特定于任务的训练。在四个关节对象任务中,其中两个是模拟任务(微波炉、门),两个是真实机器人任务(瓶子、柜子),在非回归成功的情况下,oracle 程序内存比重新探索的操作操作减少了 16-30%,而 VLM 实例化则恢复了开箱即用节省的 69-88%。因为该过程是对反馈驱动策略的软偏差,所以错误的记忆会被恢复而不是被服从:即使检索到的过程是错误的,成功仍然有效,对于 $\approx$12% 的门实例来说。在所有任务中,好处纯粹是效率之一:成功永远不会倒退,在真正的机器人上甚至会有所提高。代码将在接受后发布。