论文
学习运用想象力:世界行动模型的进步条件未来利用
Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models
摘要
世界动作模型 (WAM) 通过将未来的视觉动态纳入动作生成来扩展视觉-语言-动作 (VLA) 模型。然而,现有的 WAM 通常利用想象的未来,对不断变化的执行进度的适应有限,可能会引入分散注意力或不可靠的预测线索。这种限制源于两种根据经验确定的未来效用的不均匀性形式:(i)在进程间水平上,随着控制需求的变化,想象的未来的效用在不同执行阶段发生变化; (ii) 在内部进展层面,个体未来潜伏在同一进展状态内表现出异质相关性。为了解决这些限制,我们提出了 ProWAM,一种以进度为条件的世界行动模型,它将执行进度作为自适应想象力利用的显式中间表示。 ProWAM 包含两个紧密耦合的组件:(1)为了获得执行进度的可靠表示,我们提出了自监督双时态进度编码器(SS-DTPE)。 SS-DTPE 将短期动作观察交互建模与长期循环进度聚合相结合,以捕获最近的执行反馈和累积的任务历史记录。 (2) 以 SS-DTPE 的进度表示为条件,我们提出了分层进度条件想象力调制(HPIM),以使想象力利用率适应执行进度。 HPIM 在两个互补的层面上运行:进程间全局调制机制适应跨执行阶段的未来利用率,而进程内相关性机制区分每个进程状态内的各个未来潜在变量。大量实验表明,与强 VLA 和 WAM 基线相比,具有一致的增益。