论文

AcrossWAM1.0:面向紧凑机器人策略的模块化潜在世界—动作技术栈

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

模型优化小模型/轻量模型

摘要

潜在世界动作模型通过预测特征空间中与动作相关的视觉子目标来避免渲染未来像素。 LaWAM 建立了这个公式,但其最初的表述使世界模型、多模态骨干网和部署检查点紧密耦合。我们引入 AcrossWAM1.0,这是对这个潜在世界动作堆栈的模块化和扩展研究。我们没有将潜在子目标呈现为新算法,而是使模块边界变得明确:策略适配器产生潜在动作和动作生成上下文;保留的潜在世界解码器为当前场景中的预测过渡奠定基础;流匹配专家生成连续的动作块。我们进一步将仅训练的教师与推理图分开,并提供可验证的部署导出。在 2,000 个配对的 LIBERO 事件中,用 Qwen3.5-0.8B 替换 Qwen3-VL-2B 主干网的成功率为 97.45%,而 2B 模型的成功率为 98.00%(相差 0.55 个百分点;精确的 McNemarp=0.266)。这并不能证明等效性,但它满足预先指定的两点保留标准。紧凑的推理可达检查点包含 1,472.6M 个唯一参数,比原始 2B 策略少 42.4%,而所有保留的张量与源检查点按位相同。跨系列执行还通过 MiniCPM-V 适配器冒烟测试进行检查;闭环跨家庭转移仍然是一个开放的评估。因此,AcrossWAM1.0 为紧凑的潜在世界行动政策提供了可审计的软件和评估边界,这与 LaWAM 最初的潜在子目标贡献不同。

AcrossWAM1.0:面向紧凑机器人策略的模块化潜在世界—动作技术栈:论文配图
图1:跨WAM1.0系统边界。第一阶段由LAWAM继承:冷冻的DINOv3编码器、反动导师和潜在的世界解码员学习具有行动意义的过渡代表。整个WAM1.0系统明确暴露了第2阶段的政策界限:骨干适配器返回独立的过渡和行动环境,预测的潜伏被解码成一个可视次级目标,而流动DIT专家则产生一个动作块。烂路和反动力老师只接受训练在紧凑实验中,第1阶段教师和DINOv3被冻结,而保留的解码器则进行微调;因此,报告的结果显示是堆叠模块化和骨干缩放,而不是冻结的跨家庭转移。