论文
verdi:持续世界模型优化中检索不等于迁移
verdi: retrieval is not transfer for continual world model optimization
摘要
基础世界模型在规划、仿真和具身智能方面取得了显著进展。然而,将预训练世界模型朝着用户指定目标进行优化仍然困难:每轮优化通常都要从零重新发现优化策略,且所得知识很少能迁移到下一个模型。现有研究智能体将优化循环自动化,却把成功策略当作可直接复用的配方,缺乏何时适合迁移的原则性保障。我们主张检索不等于迁移:在一个模型上验证过的策略对另一个模型而言至多是一个优化假设,只有经过目标侧实验验证才能成为可迁移知识。基于这一原则,我们提出VERDI,一个以证据许可为核心的持续世界模型优化框架。VERDI通过共享的推理时探针刻画每个世界模型以构建优化指纹(Optimization Fingerprint),将相关的先前经验检索为排序后的假设,并在冻结的目标侧验证器下验证每个候选,之后才将其接纳为可复用证据;邻近指纹间的矛盾还会触发探针进化,持续改进诊断表示本身。在Ctrl-World、Cosmos系列和RoboCoin上的实验表明,VERDI将搜索成本降低68%、GPU成本降低69%,负迁移从0.34降至0.06,并以83%的符号准确率预测迁移结果。
