论文
必要时梦想:通过自适应多模态推理推进世界行动模型
Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning
摘要
世界动作模型(WAM)为体现智能提供了一种有前景的方法,但现有方法严重依赖视频预测作为动作先验,缺乏自适应多模态推理,限制了它们在长期复杂任务上的有效性。我们观察到,WAM 在不同的执行环境下需要不同的多模态推理模式:文本推理在任务转换期间至关重要,以指导高级动作预测,而视觉推理在细粒度操作期间至关重要,以实现精确控制。受这一观察的启发,我们提出了 \textbf{AdaWAM},一种具有自适应多模态推理能力的世界行动模型。 AdaWAM 集成了一个轻量级动态路由器,可在任务执行期间根据需要自动触发文本或视觉推理。对模拟和现实世界体现任务的实验表明,AdaWAM 显着提高了推理效率,同时优于最先进的体现策略。代码和演示位于:https://adawam.github.io/。