论文
Token预测器不是规划器:构建物理锚定的因果推理器
Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners
摘要
当前的具体视觉语言规划基准通常倾向于语言上的下一个标记预测,而不是基于物理的下一个状态推理。这奖励了模仿统计语言先验而不是跟踪因果依赖性的模型,从而将物理规划减少为浅层序列建模。我们认为,可靠的物理自主性需要从基于语言的标记预测转向基于物理的因果推理。为此,我们引入了 Causal-Plan-Bench,这是一个通过多阶段验证策划的高保真诊断套件,用于评估四个因果维度的具体规划。我们还构建了 Causal-Plan-1M,这是一个百万规模的显式推理轨迹语料库,由自我中心视频的四阶段注释管道生成。广泛的评估表明,领先的型号仍然难以展现真正的物理性能,Gemini 3 Pro 在我们的基准测试中仅达到 38.18。相比之下,我们的训练方法使基于 Qwen3-VL-8B 的因果规划器能够内化物理逻辑,以实现更准确的下一状态估计。该模型实现了强大的域内性能和跨基准泛化,并揭示了因果缩放定律:将因果训练数据缩放到 100 万个实例会产生 36.3% 的相对增益,从 33.22 到 45.28。总的来说,我们的工作为将智能体从表面的象征性预测者转变为基于物理的因果推理者迈出了具体的一步。
