论文

LifeEval:面向第一视角日常生活任务辅助AI的多模态基准

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)的快速进步标志着向通用人工智能迈出的重要一步,为增强人类能力提供了巨大潜力。然而,它们在动态真实环境中提供有效辅助的能力仍在很大程度上未被探索。现有视频基准主要通过回顾式分析或孤立感知任务评估被动理解,未能捕捉实时用户辅助的交互性与自适应性。为弥合这一空白,我们提出LifeEval,一个从第一人称视角评估日常生活中实时、任务导向人机协作的多模态基准。LifeEval强调三个关键方面:任务导向的整体评估、来自连续第一人称流的第一视角实时感知,以及通过自然对话实现的人-助手协作交互。该基准经由严格的标注流水线构建,包含6个核心能力维度共4,075个高质量问答对。对26个最先进MLLM在LifeEval上的大量评估显示,实现及时、有效且自适应的交互仍存在巨大挑战,凸显了推进以人为本交互智能的关键方向。

LifeEval:面向第一视角日常生活任务辅助AI的多模态基准
图1:LifeEval 概览。该基准强调真实生活的交互式场景,要求模型提供精确、情境感知且自适应的辅助。