论文

我在视频中寻找你:以人为中心的视频推理的身份条件查询

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

模型训练强化学习

摘要

现实世界的视频推理通常涉及多模式、多源输入,而现有的视频推理任务通常采用简化的视频文本设置,限制了身份匹配和以人为中心的推理。为了弥补这一差距,我们引入了身份条件查询(ICQ)任务,其中模型需要联合关联和解释输入视频和人的参考图像,并利用这种条件来解决身份基础、行为理解和时间推理等挑战。在 ICQ 的基础上,我们推出了 ISYV(我在视频中寻找你),这是一个由三个组成部分组成的系统解决方案:(1)ISYV-Bench,一个具有挑战性的评估基准,包含 1,377 个现实世界的复杂视频和 1,377 个问答对,分为六个难度级别,涵盖从身份识别到因果推理的能力; (2)ISYV-75K,通过自动注释、多阶段验证和人工审核构建的由75K高质量样本组成的大规模训练集; (3) ISYV-框架,包含面向 ICQ 的模型和训练策略,用于学习利用信息丰富的视频镜头,而无需额外的镜头级注释。大量实验表明,主流的闭源和开源 MLLM 在 ISYV-Bench 上都表现不佳,尤其是在跨域身份匹配和长视野跟踪方面。 ISYV 模型的性能优于强大的基线,并且在某些方面接近闭源性能。总体而言,ISYV 提供了统一的任务定义、可扩展的数据集/基准以及以人为中心的视频推理的建模见解。