论文

GTASA:用于视频模型时空分析、评估和训练的 真值 注释

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

模型评测基准与评测资源

摘要

游戏引擎保留了视频模型难以学习的内容:每一帧背后都有一个完整、明确的世界状态。我们将其变成一种数据工具。 GEST-Engine 是我们的生产级开源系统,可确定性地将时空事件图(GEST)(无论是程序生成的还是从文本派生的)执行到同步多角色场景的视频中,并在渲染时记录 真值:3D 实体和相机状态、成对空间关系、事件到帧映射、实例分割和长描述,边际注释成本为零。借助它,我们发布了 GTASA,这是系统可以以任意规模生成的 938 个视频样本,据我们所知,它具有任何视频数据集最密集的空间关系覆盖范围:每帧都有完整的实体对关系图,逐帧比现有技术密集约 84 倍。我们通过人类对物理有效性和语义对齐的评估来定性地验证 GTASA,其中前沿神经生成器在给出相同提示的情况下基本上会失败,并且通过 GTASA 预训练改进 VLM 视频字幕来定量地验证 GTASA。 GTASA 的精确 3D 真值(一种先前无法测试的冻结视频特征的实体间关系探测器)支持跨 11 个时空任务探测 6 个冻结视频编码器,结果表明,对于所有这些编码器来说,谁靠近谁几乎都是偶然的。我们发布了引擎、语料库和基准,使这一差距成为可测量、可训练的目标。