论文

VISTA:用于生成和审核以自我为中心的援助场景的可控平台

VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios

模型评测基准与评测资源

摘要

评估人工智能代理是否可以主动协助人类进行日常活动,从日常家务到紧急的安全关键情况,需要多样化的视觉数据。然而,在现实世界中收集此类场景通常很困难、成本高昂或不安全,并且模拟环境通常缺乏模拟不同行为的后果所需的社会常识。在这项工作中,我们提出了 VISTA,这是一个可控平台,它使用用户提供的场景种子(定义为对预期援助情况的简短自然语言描述)来生成可编辑的计划、以自我为中心的视频和可审计的审查跟踪。 VISTA 围绕三种交互模式构建场景意图,包括反应式、显式主动式和隐式主动式,以及两个后果系列,包括安全关键型和日常不便型,以无援助情况作为对照。其六阶段管道公开了设计概要、定时事件脚本、第一帧计划、运动计划和视频计划,允许用户在明确授权媒体生成之前以自然语言修改每个工件。人工评估表明,与两个一次性基线的输出相比,完整 VISTA 工作流程保留的视频与其场景种子更加一致。因此,VISTA 使得以自我为中心的目标场景生成可检查、可修改且可根据经验进行审核。