论文
世界模型中的幻觉是可以预测和预防的
Hallucination in World Models is Predictable and Preventable
摘要
现代生成世界模型呈现出越来越现实的行动可控的未来,但它们经常产生幻觉:预测轨迹保持视觉流畅,同时偏离 真值 动态。我们假设幻觉集中在状态动作空间的低覆盖区域,其中轻量级的以数据为中心的信号既可以检测它并指导缓解。为了测试这一点,我们引入了 MMBench2,这是一个 427 小时、210 个任务的数据集,用于使用 真值 动作、奖励和实时模拟器进行视觉世界建模,并在其上训练 350M 参数的世界模型。我们确定了三种不同的幻觉模式:感知、动作边缘化和场景发散——每种模式都锚定到管道的不同阶段,并开发了三个信号来准确预测模型将在哪里失败。为了缩小训练时的覆盖率差距,我们开发了一种覆盖率感知采样技术;为了在线关闭它们,我们的幻觉预测器作为有针对性的数据收集的好奇心奖励,产生一个数据高效的微调配方,使预训练的世界模型适应完全不可见的环境,只有 50 个真实环境轨迹。总的来说,我们的研究结果表明,世界模型中的幻觉本质上是一个数据覆盖问题,并且用于检测它的相同信号也可以用于缓解。我们论文的交互式网络版本可在 https://www.nicklashansen.com/mmbench2 获取