论文

RobotEQ-Video:以视频为中心的社会主动智能基准与世界国家分类法

RobotEQ-Video: A Video-Centric Benchmark for Social Proactive Intelligence with World-State Taxonomy

模型评测基准与评测资源

摘要

社交主动智能 (SPI) 将主动协助扩展到任务完整性之外,以考虑不同具体场景中的社交适当性。然而,先前的 SPI 研究面临两个关键限制。首先,现有的工作侧重于静态图像,而动态视频为推断人类状态和需求提供了关键线索,提供比孤立图像更丰富的信息。其次,先前的工作往往依赖于自由形式的数据收集管道,这无法保证多样化场景的全面覆盖。为了解决这些差距,我们推出了 RobotEQ-Video,将重点从以图像为中心的分析转移到以视频为中心的分析。为了确保全面的视频覆盖,我们构建了一个分层的世界状态分类法,组织成四级从粗到细的结构,包括 6 个域、20 个维度、142 个 1 级属性和 816 个 2 级属性。由此产生的基准包括 2K+ 视频、100K+ 人工注释和 16K+ 标签,用于评估行为正确性。基准评估表明,当前系统仍然不可靠,并且达不到人类的表现。我们进一步探讨世界模型如何帮助解决这一任务。这项工作将 SPI 研究从静态图像推进到动态视频,并确保基准测试期间更全面的场景覆盖。