论文

原始视频的中期训练语言模型

Mid-Training Language Models on Raw Video

模型训练预训练

摘要

多模态大语言模型主要从成对的图像文本数据或带注释的视频中学习,原始网络视频很少用于进一步训练现有的语言模型。我们研究没有字幕和文本丢失的原始视频是否可以作为预训练语言模型的中间训练数据。帧被编码成连续的视觉标记,语言模型学习预测下一个视觉标记。我们在 YT-Temporal-1B 的原始剪辑上对 Qwen3-1.7B 进行中期训练,然后对其和模型应用相同的图像文本指令调整,而无需进行中期训练,因此两者仅在训练中期有所不同。训练中期的模型在四个视频基准测试中的平均得分高出 2.9 分,在十个图像基准测试中的平均得分高出 5.1 分,涵盖感知、文档和图表任务。即使训练中期不包含文本,文本性能也得以保留,14 个文本基准的平均值为 48.9,而没有训练中期的模型的平均值为 48.0。整个训练的分析表明,图像和视频的增益在训练的 30% 内出现,此后达到稳定水平, 变化小于0.5个百分点。预测字幕未能优于下一个视觉标记预测,这表明视频中期训练可以保持纯粹的自我监督,而无需计算开销或自动字幕的标签噪声。