论文

像世界模型一样思考,像 VLA 一样行动:将世界模型表示提炼成紧凑的机器人策略

Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies

摘要

视觉-语言-行动(VLA)模型将观察结果映射到行动,但没有考虑世界如何反应的目标,因此它们的稳健性主要受数据覆盖范围的限制。世界模型恰恰承载了这个缺失的目标,并且更有基础,但将未来向前推进每个决策要花费几秒钟的时间,并将其排除在控制循环之外。我们证明两者可以分开。世界模型对物理场景的了解存在于其内部特征中;创造未来只是产生未来的目标,因此基础可以被继承,而生成机器则被留下。我们在普通 VLA 训练中添加一个特征对齐项:冻结世界模型在训练帧上运行一次并缓存,学生学会同意该缓存。训练期间没有教师加载,投影仪在训练后被丢弃,部署的策略与未提炼的基线相同,在消费类 RTX5090 上以 32ms 和 1.86GB 运行,因此每个增益都归因于表示而不是增加的容量或测试时计算。一名 0.8B 学生在 LIBERO 上达到 97.9%,在 RoboCasa-GR1 人形操纵上从 48.2% 提高到 50.5%,并且在单臂和双手平台上将相同的目标延续到真实硬件上。这种增益在学生规模、主干、对齐层和教师的变化中仍然存在,表明两个特定网络之间存在广泛的代表性先验,而不是脆弱的对齐。项目页面:此 https URL。