论文

SCOPE:面向视频世界模型的评分隔离式Agentic优化

SCOPE: Score-Isolated Agentic Optimization for Video World Models

智能体系统Agent Harness

摘要

视频世界模型越来越多地被用作规划和具身决策的模拟器,但在推理时改进它们引入了一个微妙的评估问题:提示、采样器、验证器和选择器可能一起演化,难以归因收益或防止held-out反馈塑造最终策略。我们引入SCOPE(评分隔离的Agentic优化),一个对冻结视频世界模型进行可审计推理时适应的框架。SCOPE将外部控制表示为带类型的状态,仅通过开发证据支持的有界变更更新该状态,并在held-out评估前冻结所得策略。在Physics-IQ基准上,SCOPE相对完全相同的冻结基座提升+14.24(95% CI [+8.10, +21.23])。受控消融进一步识别出收益来自场景规范、采样和学习式选择,而相对最强匹配Agentic基线的优势仍未有定论。跨骨干和前瞻性评估揭示了一个互补结果:有用的推理时更新存在,但其收益不能在不同模型和设置间均匀迁移。这些发现共同表明,可靠的推理时适应不仅需要更好的提案,还需要一个有原则的机制来决定哪些更新应成为部署系统的一部分。代码见 https://github.com/YuhuaJiang2002/SCOPE。

SCOPE:面向视频世界模型的评分隔离式Agentic优化:论文配图
图2:匹配的 Physics-IQ 策略在两个冻结骨干上的演化。R0–R3 分别对应 Base、物理卡片(physics-card)更新、规则细化更新以及最终选定的 Scope 状态。曲线显示 40 个场景上的平均 Physics-IQ 得分,阴影区域为 95% 场景自助法(bootstrap)置信区间。得分仅在各骨干内部进行比较。