论文

PRISM:用于具身视觉语言模型的多视图多功能零售视频数据集

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

模型训练监督微调与指令调优

摘要

对最先进的物理人工智能模型的通用视觉理解与结构化现实世界部署环境的专门感知需求之间存在着重大差距。我们推出了 PRISM,这是一个 27 万样本多视图视频监督 微调 (SFT) 语料库,用于现实零售环境中的具身视觉语言模型 (VLM)。 PRISM 的动机是一个简单的观察——物理人工智能系统失败并不是因为视觉识别能力差,而是因为它们对空间、物理动力学和具身动作的理解不够好,无法在世界上可靠地运行。为此,PRISM 基于一种新颖的三维知识本体,涵盖空间知识、时间和物理知识以及具体行动知识。它涵盖了四个评估维度的 20 多个能力探针——具体推理 (ER)、常识 (CS)、空间感知 (SP) 和直觉物理 (IP),据我们所知,PRISM 是第一个在单个现实世界部署域中实例化所有三个知识维度的数据集。该语料库从五个超市地点的自我中心、外中心和 360° 视角捕获数据,并包括开放式、思维链和多项选择监督。在 4 fps 下,PRISM 跨越约 1180 万个视频帧和约 7.3 亿个词元,使其跻身最大的特定领​​域视频 SFT 语料库之列。 PRISM 上的 微调 将所有 20 多个探针的错误率比预先训练的基线降低了 66.6%,在具身动作理解方面取得了显着进展,准确性提高了 36.4%。我们的结果表明,本体结构的、特定领域的 SFT 可以有效地增强现实世界环境中的具体 VLM。 PRISM 数据集和更多详细信息请访问 https://dreamvu.ai/prism