论文

大型多模态模型中的个人视觉情境学习

Personal Visual Context Learning in Large Multimodal Models

模型评测基准与评测资源

摘要

随着智能眼镜等可穿戴设备将大型多模态模型 (LMM) 集成到个人用户的连续第一人称视觉流中,这些模型向真正的个人助理的演变取决于视觉个性化:对佩戴者独有的视觉信息进行推理的能力。我们将此功能形式化为个人视觉上下文学习(个人 VCL),即使用用户特定的视觉上下文来解决个性化查询的提示时间功能。为了系统地评估这一点,我们提出了 Personal-VCL-Bench,这是一个捕捉跨人、物体和行为的个人视觉世界的综合基准。我们对前沿 LMM 的分析发现了巨大的上下文利用差距,揭示了利用视觉证据以及聚合多个视觉观察的机制仍然严重不足。受这些发现的启发,我们提出了 Agentic Context Bank,这是一个强大的推理时间基线,它将用户的视觉上下文构建成一个自我精炼的记忆库,并采用查询自适应证据选择。我们的基线方法不断改进跨任务和评估主干的标准上下文提示机制,展示了通往未来个性化 LMM 的实用路径。