论文
世界模型的突破点:自然输入故障发现
Where World Models Break: Natural-Input Failure Discovery
摘要
世界模型预测以行动为条件的未来,并作为下游规划和控制的关键内部模拟器。然而,世界模型的灾难性预测失败可能会通过控制管道危险地传播,因为后续代理或 模型训练 和决策在很大程度上取决于这些世界模型预测的连续环境演变。现有的评估忽略了这种系统性风险:通过汇总一般查询中良性代的平均误差,它们无法对模型在罕见或未观察到的条件-动作组合下的灾难性崩溃进行压力测试。为了弥补这一差距,我们形式化了自然输入故障发现问题:在有限的查询预算下,找到环境有效的条件和导致严重预测风险的操作前缀,验证这些故障是否在新鲜种子上重现,并测试它们在附近有效编辑下的持久性。发现此类关键故障在计算上具有挑战性,因为有效的条件-动作组合呈指数级爆炸,考虑到嘈杂的预测轨迹成本高昂,使得详尽的搜索或标准采样变得不可行。为了解决这个问题,我们提出了 BasinLens,它通过将不确定性引导的全局搜索与类型化的本地替换配对,利用有效输入的底层结构,其中每个坐标都拥有环境定义的语义类型和可接受的域。在不同的基准和世界模型系列中,BasinLens 揭示了传统评估无法揭示的可重现和局部持久的故障模式,表明平均情况基准可以掩盖世界模型驱动控制中的重要漏洞。