MAVEN:用于视频推理任务的多阶段代理注释管道
MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
摘要
用于视频事件推理的视觉语言模型 (VLM) 训练需要高质量的结构化注释,不仅要捕获发生的情况,还要捕获发生的时间、地点、原因以及后果,其规模是手动标记无法支持的。我们提出了 MAVEN(多阶段代理视频事件注释),这是一个多阶段代理管道,可将原始视频转换为具有思想链 (CoT) 推理轨迹的多任务训练数据,并围绕指定的焦点事件进行组织。 MAVEN 的核心是从三个互补的字幕级别合成多尺度时空事件描述 (MSTED);这个显式中间体充当跨多种任务格式的下游问答生成的唯一输入。至关重要的是,MAVEN 支持代理驱动的领域适应:给定新的视频数据集和目标问题示例,代理会自上而下地重新设计所有提示,而无需手动重新设计。分层细化循环进一步根据分类法对注释错误进行分类,追踪原始管道阶段的根本原因,并应用重写提示或修改管道结构本身的有针对性的编辑,从而迭代地提高数据质量。我们应用 MAVEN 来标记超过 5,300 个交通视频,并根据结果数据微调 Cosmos-Reason2-8B。在私人 CCTV 评估集上,微调 超过了 Gemini 2.5 Pro 和 3.1 Flash,其中 MCQ 精度比零样本提高了 38.8 美元点。在 AccidentBench 上,仅使用 CCTV 的训练将 Cosmos-Reason2 的 MCQ 分数提升了 $+10.7$,并且与 Gemini 2.5 Pro 相当,尽管没有看到行车记录仪视频;添加适合代理的行车记录仪注释缩小了与 Gemini 3.1 Flash 的差距,并且 RL 后训练 使整体性能超过了 Gemini 基线。仓库监控和公共安全视频的定性结果进一步表明,代理工作流程很容易使管道适应新领域。