论文
预测导出的中到完整世界模型级联的配对精确重置评估
Paired Exact-Reset Evaluation of a Prediction-Derived Medium-to-Full World-Model Cascade
摘要
现有的自适应推理和世界行动模型系统使用廉价阶段输出或预测的未来来分配额外的计算。我们研究一个更狭窄的问题:在配对的精确重置物理结果下,当切换到单独冻结的完全预测器时,中等派生的接口是否可以预测是否可以改善特定于任务的决策损失,足以证明顺序开销的合理性?我们的贡献是成对的评估和审计协议,而不是新的通用路由规则:所有候选操作都从相同的重置状态执行,Medium 和 Full 操作在相同的候选集和任务上,它们的成对物理损失差异定义了路由目标。在新的 PushT 库(V106;1,600 个状态、39 个任务、三个检查点对)上,与独立的 Medium、独立的 Full 和延迟优势的仅任务路由器相比,冻结的预测接口路由器降低了包含开销的决策成本。然后,我们使用该任务、当前 DINO 特征的维度匹配投影以及所有五个候选操作,针对更强的当前状态控制,前瞻性地密封第二个 1,600 状态 PushT 确认(V107),并且不收取 DINO 编码器延迟。预测接口将定价的物理决策成本降低了 0.002549(状态聚类 95% 区间 [-0.002867, -0.002238];单边 95% 上限 -0.002286),对所有三个检查点对产生负面影响。受控 PyBullet 审计独立支持复合任务预测机制路由器。顺序路由器仍然比固定策略慢,并且其优势仅限于较低的计算价格。证据支持所测试的预测接口中的增量路由信息超出了一种故意偏爱的当前 DINO 控制,但不支持因果充分性、计算节省、闭环价值或跨系列通用性。