论文
ScratchWorld:评估世界模型是否计算可执行后果
ScratchWorld: Evaluating If World Models Compute Executable Consequences
摘要
世界模型评估通常通过与目标状态或观察的重叠来对预测的未来进行评分。在稀疏变化的世界中,这可以将复制的持久状态转变为明显的准确性。我们引入了 ScratchWorld,这是一个离线诊断基准,它将 Scratch 项目视为可执行世界,并使用固定的 Scratch VM 来生成经过重放验证的转换、隐藏变量、因果跟踪和反事实结果。 ScratchWorld 评估下一状态预测、长期跟踪、因果事件归因和反事实预测;每个重放验证的目标都可以在原始程序、结构化状态、自然语言或渲染输入模式下呈现,并且我们的实验使用结构化状态条件。其主要状态指标是值感知的更改字段 $F_1$,它仅对更改字段及其执行值给予信用。在包含 659 个示例的版本中,七个提示语言/推理模型在仅限状态的部分观察压力测试中最多达到 13.8% 的价值感知更改字段 $F_1$。相同实例的复制诊断使重叠混淆变得具体:复制输入状态达到 98.0% 的隐含全状态字段准确度和 0.0% 的更改字段 $F_1$,在实际项目中具有最大的膨胀。辅助诊断将隐藏状态预测轨迹漂移、干预敏感性、因果归因和扰动鲁棒性分开。在这些设置中,模型通常会对操作或干预做出反应,而不遵循确定更改值的可执行规则。