论文

BAC:将角色身份和空间位置接入视频描述与问答

Beyond Anonymous Captions: Grounding Character Identity in Video Captioning and Question Answering

模型训练模型评测应用与实践监督微调与指令调优基准与评测资源通用理解与问答

摘要

将人们的外表和行为与角色身份联系起来对于理解视频叙事至关重要。我们提出了一个身份感知视频字幕和以人为中心的问答框架,该框架结合了自动字符识别、显式空间基础和特定于任务的适应。从 LSMDC v2 影片剪辑开始,我们的管道将检测到的面孔与演员参考图像进行匹配,跨帧跟踪角色,并使用与身份相关的边界框构建输入。强大的视觉语言模型生成身份识别字幕和问题,这些字幕和问题经过手动验证和过滤,以创建 750 个带字幕的剪辑和 3,000 个以人为中心的问题的基准。我们研究了五种基础策略,将文本坐标与视觉面部或视频-MLLM 系列中的估计人物框相结合,参数大约为 2B、4B 和 8B 以及更大的前沿模型。将视觉面部框与文本坐标相结合可以在不同尺度上产生最一致的性能,并且比单独坐标显着提高整体性能。较小的型号 当被查询人未Grounding时,往往会过度分配已知身份,而较大的模型可以更好地识别此类身份不明的情况。我们引入了 LoRA 的 BAC,在大约 32K 身份识别字幕剪辑上以 2B、4B 和 8B 比例微调 Qwen 模型。在所有规模上,BAC 的表现都优于所有其他经过评估的同等规模的模型系列。 BAC-8B 的整体 QA 准确率达到 93.20%,在我们研究评估的前沿模型中仅落后于 GPT-5.6 Sol。总的来说,明确地传达谁在哪里,再加上轻量级的特定于任务的适应,可以在不改变底层架构的情况下大大提高身份感知视频的理解。我们在 https://github.com/momentslab/beyond-anonymous-captions。 发布基准、训练数据、代码和 BAC 检查点

BAC:将角色身份和空间位置接入视频描述与问答:论文原图
图 1:使用基于采样视频帧的角色身份的身份感知字幕和以人为中心的 QA 示例。