论文
AcrossWAM1.0:面向紧凑机器人策略的模块化潜在世界—动作技术栈
AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies
摘要
潜在世界动作模型通过预测特征空间中与动作相关的视觉子目标来避免渲染未来像素。 LaWAM 建立了这个公式,但其最初的表述使世界模型、多模态骨干网和部署检查点紧密耦合。我们引入 AcrossWAM1.0,这是对这个潜在世界动作堆栈的模块化和扩展研究。我们没有将潜在子目标呈现为新算法,而是使模块边界变得明确:策略适配器产生潜在动作和动作生成上下文;保留的潜在世界解码器为当前场景中的预测过渡奠定基础;流匹配专家生成连续的动作块。我们进一步将仅训练的教师与推理图分开,并提供可验证的部署导出。在 2,000 个配对的 LIBERO 事件中,用 Qwen3.5-0.8B 替换 Qwen3-VL-2B 主干网的成功率为 97.45%,而 2B 模型的成功率为 98.00%(相差 0.55 个百分点;精确的 McNemarp=0.266)。这并不能证明等效性,但它满足预先指定的两点保留标准。紧凑的推理可达检查点包含 1,472.6M 个唯一参数,比原始 2B 策略少 42.4%,而所有保留的张量与源检查点按位相同。跨系列执行还通过 MiniCPM-V 适配器冒烟测试进行检查;闭环跨家庭转移仍然是一个开放的评估。因此,AcrossWAM1.0 为紧凑的潜在世界行动政策提供了可审计的软件和评估边界,这与 LaWAM 最初的潜在子目标贡献不同。
