论文

PEAM:在Minecraft中通过经验的对比内化实现参数化具身代理记忆

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

模型训练模型架构MoE参数高效训练

摘要

我们提出 PEAM,一个 Minecraft 中的参数化具身代理记忆(Parametric Embodied Agent Memory)框架,它把代理记忆从推理时检索转变为通过经验内化的参数驻留技能。PEAM 把一个用于开放式推理的慢速深思型 LLM 与一个用于已固化技能反射式执行的快速参数模块配对。快速模块是一个多模态专家混合(MoE)LoRA 架构,具有按类别物理隔离的适配器,从而实现无灾难遗忘的参数级持续学习。我们把失败当作一等训练信号:失败-纠正轨迹对通过行为克隆与对比目标的联合训练被内化,因此代理不仅学到什么会成功,还学到纠正后的动作与失败动作有何不同。为治理固化过程,PEAM 引入参数化价值分数来决定哪些经验应被内化,并引入无标度的自触发固化机制来决定何时内化,无需任务特定的手工调阈值;由于触发器可跨任务分布迁移而无需重新调参,代理得以自我演化。在 Minecraft 中的实验表明,PEAM 提升长时程任务表现,缓解对已固化技能的遗忘,并且在参数化相对检索的效率上优于基于检索的具身代理和参数记忆变体。

PEAM:在Minecraft中通过经验的对比内化实现参数化具身代理记忆:论文配图
图 2:PEAM 架构。慢速层产生的成功且正确的轨迹在情景记忆中上演。 PV 选择哪些跟踪值得内部化,STC 确定何时应该运行合并,联合 BC+DPO 更新相应的隔离类别适配器。在推理时,快速参数模块直接执行综合技能,并在验证失败时回退到慢速层。