论文

动态环境中具身智能体的测试时世界模型混合

Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments

智能体系统Agent 环境交互

摘要

基于语言模型(LM)的具身智能体日益部署于真实场景。然而,在动态环境中其适应性仍然有限,而构建准确、灵活的世界模型对有效推理与决策至关重要。为应对这一挑战,我们把专家混合(MoE)范式扩展到具身智能体。传统MoE架构将知识模块化为带预训练路由的专家组件,但一经部署便保持僵化,使其难以适应动态环境中的未见领域。因此,我们提出测试时世界模型混合(TMoW),一个增强对未见与演化领域适应性的框架。TMoW在测试时更新其世界模型路由函数,不同于路由保持固定的传统MoE,使智能体能够重组既有模型并集成新模型以持续适应。它通过以下方式实现:(i)多粒度原型路由,跨物体级到场景级相似性调整混合;(ii)测试时精炼,在推理期间将未见领域特征与原型对齐;(iii)蒸馏混合增强,用少样本数据与既有原型高效构建新模型。我们在VirtualHome、ALFWorld与RLBench基准上评估TMoW,在零样本适应与少样本扩展场景中均展现强劲性能,表明它使具身智能体能够在动态环境中有效运作。

动态环境中具身智能体的测试时世界模型混合
图2:TMoW 总体框架。