论文

未来为何分岔?随机物理世界模型的可识别闭合检验

Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models

模型评测评测方法与指标

摘要

随机世界模型通常通过预测未来的准确性和校准性来评估。这些标准留下了决策相关的模糊性:相同的条件未来分布可能因为观测到的状态 aliases(同态)不同的物理状态,或者在宣布的完整状态固定后,动态仍然随机。我们证明,这种归属是无法从普通转移数据中识别的,即使使用最优的概率性预测器。我们引入 ClosurePairs,这是一种介入性评估协议,通过重复的外在干扰,将兼容的微态交叉。双向方差分解可以识别状态 aliases(同态)和过程噪声,以及它们的非线性交互;独立重复的变异版本在干扰不能重复时应用。在等价似然性 Gaussian 系统上,对齐监督将 alias-fraction 错误减少 15.96 倍,同时在相同的测试 NLL 下,alias-fraction MAE 减少 15.96 倍。在 18 种非线性 Langevin 条件下,它将 attribution MAE 从 0.372 减少到 0.051,sensing regret 从 0.0138 减少到 0.0003,同时不改变 NLL。在受像素条件影响的循环模型中,冻结共享状态的探针将 alias-fraction MAE 减少 0.584 到 0.130,同时在分布外 0.630 减少到 0.170。最后,在匹配总方差的 REFINE/BRANCH 测试中,总方差路由器达到 66.48%±1.06% 的准确率,而 ClosurePairs 则达到 99.99%±0.02% 的准确率,同时改进了选择后的 NLL 从 -2.087 减少到 -2.717。因此,ClosurePairs 评估了未来分支的原因,而正确的预测分数无法识别。