论文

Kuration SDK:以数据筛选诊断世界模型可玩性差距

Kuration SDK: Addressing the Virtual2Real Gap via Data Curation

AI 基础设施模型训练模型评测预训练数据基础设施评测方法与指标

摘要

衡量动作条件世界模型质量的基准仍在不断发展,并从基于视觉相似性的指标转向基于动作语义和物理基础的指标。然而,对于与领域和任务无关的动作条件世界模型训练,现有基准提供的信号有限。通过在《反恐精英》游戏数据上训练和评估扩散世界模型,我们确认定性可玩性与 FVD、LPIPS 和 JEDi 等指标不相符。我们将其称为“虚拟与真实”差距。我们认为,在训练开始之前,管理原始游戏数据并测量各种诊断属性可以提供更强大的信号来弥补差距,而不是可靠的基准。我们提出了几种管理策略和一个用于物理人工智能数据管理的通用工具包,称为 Kuration SDK,该工具包随本文开源。该 SDK 有助于揭示特定案例中虚拟与真实差距的根本原因:为什么在相同的游戏地图、动作和状态分布上训练的两个世界模型,尽管具有非常相似的 LPIPS 和 FVD 分数,但在玩游戏时表现却截然不同。因此,Kuration SDK 有潜力揭示特定数据集中 Virtual2Real 差距的根本原因,并加速样本高效训练数据集的开发。

Kuration SDK:以数据筛选诊断世界模型可玩性差距:论文原图
图 1:跨训练基线_v1 的 LPIPS、FVD 和 JEDi,在 CS2 测试集上进行评估,绘制在三个共享轴上。虚线显示同一测试集上的 DIAMOND 模型(此测试集上不存在 JEDi 参考)。 LPIPS 随着噪声的增加而提高; FVD仅在早期阶段具有竞争力,然后振荡; JEDi 在每个评估的检查点都有所提高,但可玩性仍然较差。