论文

EgoArgus:将 VLM 作为基于模态的用户支持的情景助手进行基准测试

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

模型评测基准与评测资源

摘要

VLM 越来越多地被定位为日常助手,可以感知第一人称环境、跟踪用户对话并决定如何提供帮助。现有的以自我为中心的基准主要孤立地评估视觉理解,当视觉证据和用户提供的语言有帮助、不相关或冲突时,模型是否可以在两者之间进行仲裁尚不确定。我们引入了 EgoArgus,这是一个人工注释的数据集,用于评估以自我为中心的助手在五个对话视频日常场景中的理解和决策任务。我们的结果表明,当前的 VLM 作为可靠的以自我为中心的助手仍然具有挑战性,这需要确定哪种方式值得信赖并决定何时需要进行干预。更深入的分析还表明,现有的模态偏差缓解方法在提高性能方面受到很大限制,这为帮助实践者将当前 VLM 部署为日常助手提供了见解。