论文
通过人类-人工智能监督构建精确的视频语言
Building a Precise Video Language with Human-AI Oversight
摘要
视频语言模型 (VLM) 学习通过自然语言推理动态视觉世界。我们引入了一套开放数据集、基准测试和可扩展监督方法,可实现精确的视频描述。首先,我们定义了一个用于描述主题、场景、运动、空间和摄像机动态的结构化规范,其基础是与电影制作人等专业视频创作者开发的数百个精心定义的视觉基元。接下来,为了策划高质量的字幕,我们引入了 CHAI(基于批评的人类人工智能监督),这是一个框架,训练有素的专家可以对模型生成的前字幕进行批评并将其修改为改进的后字幕。这种分工通过将文本生成转移到模型来提高注释的准确性和效率,使人们能够更好地专注于验证。此外,字幕前和字幕后之间的这些批评和偏好为通过 SFT、DPO 和推理时间缩放改进字幕生成、奖励建模和批评生成方面的开源模型 (Qwen3-VL) 提供了丰富的监督。我们的消融表明,在我们的监督框架的保证下,精确度、召回率和建设性方面的批评质量直接控制着下游绩效。在适度的专家监督下,生成的模型优于 Gemini-3.1-Pro 等闭源模型。最后,我们将我们的方法应用于大型专业视频(例如电影、广告、游戏)的重新字幕,并对视频生成模型(如 Wan)进行微调,以更好地遵循最多 400 个字的详细提示,实现对电影摄影的更精细控制,包括摄像机运动、角度、镜头、焦点、视角和取景。我们的结果表明,精确的规范和人类人工智能监督是专业级视频理解和生成的关键。数据和代码可以在我们的项目页面上找到:https://linzhiqiu.github.io/papers/chai/