论文

小米 OneVL:带有视觉语言解释的一步式潜在推理和规划

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

模型推理推理策略与问题分解

摘要

思想链 (CoT) 推理已成为基于 VLA 的自动驾驶中轨迹预测的强大驱动力,但其自回归性质带来的延迟成本阻碍了实时部署。潜在 CoT 方法试图通过将推理压缩为连续隐藏状态来缩小这一差距,但始终达不到其显式对应方法。我们认为这是由于纯粹的语言潜在表征压缩了世界的符号抽象,而不是实际控制驾驶的因果动态。因此,我们提出了 OneVL(带有视觉语言解释的一步潜在推理和规划),这是一种统一的 VLA 和世界模型框架,通过由双辅助解码器监督的紧凑潜在词元进行推理。除了重建文本 CoT 的语言解码器之外,我们还引入了一个视觉世界模型解码器,可以预测未来帧标记,迫使潜在空间内化道路几何、代理运动和环境变化的因果动态。三阶段训练流程逐步将这些潜在变量与轨迹、语言和视觉目标结合起来,确保稳定的联合优化。在推理中,辅助解码器被丢弃,所有潜在词元都在单个并行通道中预填充,与仅答案预测的速度相匹配。在四个基准测试中,OneVL 成为第一个超越显式 CoT 的潜在 CoT 方法,在仅应答延迟下提供卓越的准确性。这些结果表明,通过世界模型监督,潜在 CoT 比详细的逐个标记推理产生更通用的表示。代码已向社区开源。项目页面:https://xiaomi-embodied-intelligence.github.io/OneVL