论文

RolloutFaith:审计视觉世界模型中的持续内部干预

RolloutFaith: Auditing Persistent Internal Interventions in Visual World Model

模型评测评测方法与指标

摘要

探针、激活补丁和学习编辑器等可解释性方法旨在揭示或修改模型的当前计算。世界模型提出了更严格的要求:因为它们的预测会成为以后预测的输入,所以在编辑停止后必须保留有用的内部校正。因此,我们提出了 RolloutFaith,一个框架,用于衡量干预时产生的预测以及固定事件、动作、噪声和信息预算下的后续自主预测的语义改进。我们在 Crafter、Cartpole 和 CoinRun 的三个世界模型上评估了 10 名合适的编辑器。我们还使用参考激活修补,它将模型激活替换为根据真实观察计算的配对激活,以测量所选接口处可用的校正。这种参考干预改善了所有九种模型和任务组合中的后续预测,并且在八种组合中优于最适合的编辑器,但在九种组合中的五种中,其持续增益随着范围的增加而减少。当前安装的编辑器只能恢复有限且不一致的长期效果。通过将各个状态组件恢复到未触及的值,我们发现持久效果会穿过 DIAMOND 中最新生成的帧、DreamerV3 中的循环内存以及 STORM 中的循环内存。这些发现表明,训练应该奖励未来的后果。为了检验这一假设,我们提出Delayed LoReFT,它通过四个冻结的未来转变来优化相同的低秩干预,并在一定程度上提高持续干预效果。