论文
采样余量不是选择增益:视频世界模型测试时间缩放的计算值审核
Sampling headroom is not selection gain: a compute-value audit of test-time scaling for video world models
摘要
仅当额外的计算产生更好的候选并且系统可以可靠地识别它们时,测试时间缩放(TTS)才能改善生成。这种区别对于视频世界模型尤其重要,其中更广泛的样本池可能包含更强的预测轨迹,而不会改善最终选择的输出。我们引入了计算价值审计(CVA),这是一个顺序框架,询问额外的采样是否创造了机会,可观察的信号是否提供了可靠的状态,该状态支持有益的行动,以及由此产生的收益超过了生成和验证的全部入场费。在 192 个物理智商场景中,将候选池从 4 名扩大到 16 名,预言机质量提高了 +9.23 IQ(95% CI [+7.44,+11.14]),但 Flow、Cycle 和 VideoReward 无法可靠地恢复这一空间。在三个生成器中,十二个自适应深度策略中没有一个优于统一计算;他们只收回了所测入场费的 42-69%。对 VideoPhy2 的匹配 60-NFE 预测和扰动干预对于三个新鲜种子副本同样是负面的。这些负面结果并不普遍:锚点探索器在稀疏 PRM800K 设置中通过了所有四个阶段,MMLU-Pro 暴露了预测状态和有用操作之间的差距,特权配对未来建立了正视频上限。总之,这些结果表明,只有当采样余量可以转换为可靠的决策(且其收益可以承受全部计算费用)时,采样余量才具有部署价值。代码可在 https://github.com/YuhuaJiang2002/sampling-headroom-is-not-selection-gain 获取。