论文

当低预测误差误导规划时:诊断潜在世界模型中的表示、动态和决策失败

When Low Prediction Error Misleads Planning: Diagnosing Representation, Dynamics, and Decision Failures in Latent World Models

模型评测评测方法与指标

摘要

主导潜在世界模型预测误差的组件不一定是其修复最能改善动作选择的组件。我们通过比较相同物理起点的动作序列并将端点错误分离为候选池中心和动作相关响应来展示这一点。在四个模型系列和四个任务中,每个任务 256 个新启动和每个启动 300 个共享候选的确认池表明,中心误差在 14/16 模型任务单元中主导 MSE。然而,在其中六个单元中,仅校正动作相关反应的预言机比仅校正中心的预言机产生更好的物理排名相关性和前 30 名精英质量,同时留下更多潜在的 MSE(家庭明智校正区间)。评估设置之间的偏好有所不同:执行预言机选择的操作的单独 LeWorldModel (LeWM) 研究有利于在 PushT 和 Reacher 上进行中心修复,并具有渲染匹配的目标。匹配候选测试本地化排序损失:对于 LeWM,编码实现的端点在 Reacher 设置上将物理 Spearman 从 0.464 提高到 0.975,在 PushT 上从 0.193 提高到 0.631(每个任务 64 次启动),而 Cube 的编码目标成本仍然无法提供信息。一项 72 次运行的客观研究改进了选定的响应诊断,但增量闭环规划收益仍未得到证实。这些结果将误差大小与预言校正的决策效果分开,并激励将表示、预测和规划作为单独的阶段进行评估。

当低预测误差误导规划时:诊断潜在世界模型中的表示、动态和决策失败的原论文方法或结果图
图 1:诊断框架概述。 (a) 从一个恢复状态开始,两人预测并实现了替代动作序列的结果。 (b) 将中心误差与动作相关响应误差分开,然后区分响应尺度和方向。 (c) 对于相同的候选者,比较预测与实现的结果成本 ($P/E$),以及中心与仅响应预言机修复 ($C/S$)。 (d) 测试从响应保真度转移到物理候选人排名和精英质量,然后闭环规划。虚线箭头标记通过单独测试评估的传输。潜在几何是示意性的。