论文

Flex-$π$:具有计算灵活性的多流世界动作模型

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

模型训练监督微调与指令调优

摘要

世界动作模型 (WAM) 预测未来会表现得更好,但几乎所有模型都仅预测 RGB 潜在模型,纯粹为像素重建而训练,没有满足 3D 几何或对象语义操作需求的明确信号。我们发现了令人惊讶的免费午餐:编码 RGB 的相同冻结视频生成 VAE 也几乎无损地编码 3D 点图,根本不需要针对点图的训练。这让我们能够在 3D 几何和以对象为中心的 DINO 语义以及 RGB 上监督 Flex-$π$(6B 参数 WAM),而无需新传感器、新 预训练 或推理延迟的成本。每个视觉信号都被投射到这个共享的潜在空间中,并与 Mixture-of-Transformer 主干网内的动作联合去噪;然后,使用跨模态强制的每个流丢失让单个经过训练的检查点在这些流的任何子集上运行,从快速仅操作模式到完整的联合生成。其结果是一种具有极高示范效率和良好泛化性的策略,在灵巧、精确、现实世界的双手操作任务(无论是分布内还是分布外)上都比最强基线高出 2-7$\times$,同时运行速度比 $π_{0.5}$ 更快。我们的项目网站:https://flex-pi.github.io/