论文
SCOPE:面向视频世界模型的评分隔离式Agentic优化
SCOPE: Score-Isolated Agentic Optimization for Video World Models
摘要
视频世界模型越来越多地被用作规划和具身决策的模拟器,但在推理时改进它们引入了一个微妙的评估问题:提示、采样器、验证器和选择器可能一起演化,难以归因收益或防止held-out反馈塑造最终策略。我们引入SCOPE(评分隔离的Agentic优化),一个对冻结视频世界模型进行可审计推理时适应的框架。SCOPE将外部控制表示为带类型的状态,仅通过开发证据支持的有界变更更新该状态,并在held-out评估前冻结所得策略。在Physics-IQ基准上,SCOPE相对完全相同的冻结基座提升+14.24(95% CI [+8.10, +21.23])。受控消融进一步识别出收益来自场景规范、采样和学习式选择,而相对最强匹配Agentic基线的优势仍未有定论。跨骨干和前瞻性评估揭示了一个互补结果:有用的推理时更新存在,但其收益不能在不同模型和设置间均匀迁移。这些发现共同表明,可靠的推理时适应不仅需要更好的提案,还需要一个有原则的机制来决定哪些更新应成为部署系统的一部分。代码见 https://github.com/YuhuaJiang2002/SCOPE。
