论文

Frames2LoRA:视觉语言模型的参数视频内化

Frames2LoRA: Parametric Video Internalization for Vision-Language Models

上下文与知识上下文工程

摘要

在视觉语言模型中处理视频的成本很高:每一帧占用数百个标记,并且推理成本随着每一帧和每次重复查询而增加。我们介绍 Frames2LoRA,一种参数化视频内部化方法。当冻结的 VLM 编码视频时,感知器超网络逐层读取生成的中间表示,并在单次前向传递中生成低秩适应 (LoRA) 适配器。与需要迭代梯度更新的标准 LoRA 微调 不同,Frames2LoRA 直接从视频预测这些权重。 Frames2LoRA 针对 SmolVLM2 500M 和 2.2B 进行了视频摘要和字幕方面的训练,使相同的冻结 VLM 能够单独回答来自适配器的查询,在查询时其上下文中的视觉标记为零。 Frames2LoRA 在统计上并不逊色,相当于在两个模型规模的所有五个字幕基准上以及在八个视频问答基准规模配对中的七个上进行的直接视频上下文推理。尽管仅在 384 像素的 12 帧上进行训练,但它在高达 1,024 帧和 1024 像素的情况下仍保持稳定,在这种情况下,直接视频上下文推理通常会退化。在整个扫描过程中,它将应答时间视觉标记负载减少了高达 1,500 倍,并将查询 TTFT 减少了 6-80 倍,同时保留了视频忠实的输出。我们还发现,独立生成的非重叠视频片段的适配器可以在秩空间中组合,这表明了一条通往分块长视频内化的路径。