论文

在以自我为中心的视频中进行个性化问答的第一视角证据定位

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

模型评测基准与评测资源

摘要

我们首次对需要自我扎根的个性化问答中的多模态 大语言模型 (MLLM) 进行系统分析,即理解以自我为中心的视频中的摄像机佩戴者的能力。为此,我们推出了 MyEgo,这是第一个以自我为中心的 VideoQA 数据集,旨在评估 MLLM 理解、记忆和推理相机佩戴者的能力。 MyEgo 包含 541 个长视频和 5K 个性化问题,询问“我的事情”、“我的活动”和“我的过去”。基准测试显示,跨变体的竞争性 MLLM,包括开源与专有、思考与非思考、小型与大型,都在 MyEgo 上挣扎。顶级闭源和开源模型(例如 GPT-5 和 Qwen3-VL)仅达到 46% 和 36% 的准确度,分别落后于人类近 40% 和 50%。令人惊讶的是,显式推理和模型缩放都没有产生一致的改进。当明确提供相关证据时,模型会得到改善,但随着时间的推移,收益会下降,这表明跟踪和记住“我”和“我的过去”的局限性。这些发现共同强调了自我扎根和长期记忆在以自我为中心的视频中实现个性化质量检查的关键作用。我们希望 MyEgo 和我们的分析能够促进这些领域的进一步进展,以实现以自我为中心的个性化帮助。数据和代码可在 https://github.com/Ryougetsu3606/MyEgo 获取