论文

潜在世界模型的自适应计算:增加深度何时有益、有害或无影响

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

模型推理测试时计算扩展

摘要

世界模型的提前退出或混合深度预测器可为每步轨迹展开分配不同计算深度,其前提是更多深度带来更好的预测。在规划所用的自回归展开中,这还要求单步精度优势能在多步组合中保留。作者用预注册指标“浅层惩罚”ρ,即最浅出口轨迹误差与完整深度轨迹误差之比,在九个DeepMind Control任务上比较匹配的单步K=1和多步K=4训练,每项使用八个随机种子。 结果出现三种状态:6/9任务中深度有益,ρ最高约8倍;2/9任务中深度反而有害,ρ最低0.87;其余任务影响很小。反转来自训练而非环境动力学,仅在首个展开步骤监督提前出口即可消除反转,差异为+0.28,n=8且分布不重叠。这形成一个矛盾:让提前出口可供路由使用的逐步深监督,也会训练它们在轨迹展开中优于完整网络。训练前冻结、仅依赖维度信息的分类器能够预测留出任务的状态,包括极端外推。 Transformer预测器也重现了反转,但表现依赖指标空间、时域长度、编码器、骨干和训练数据,其中数据影响最强。在重训的两个任务上,使用表现较好的策略所产生的数据,在损失不变时消除了反转及原有深度权衡。在CEM规划器中,ρ能预测规划是否从更深计算中受益。阈值与判定门均在相应计算前固定,包含对最初假设的预注册负向结果。更多计算是否有用取决于运行配置,而非仅取决于任务。