论文
GazeQwen:用于流媒体视频理解的轻量级凝视条件 LLM 调制
GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding
摘要
当前的多模态 大语言模型 (MLLM) 无法有效利用眼睛注视信息进行视频理解,即使通过视觉覆盖或文本描述提供注视线索也是如此。我们引入了 GazeQwen,这是一种参数有效的方法,它通过隐藏状态调制为开源 MLLM 配备凝视感知。其核心是一个紧凑的注视重采样器(~1-5 M 可训练参数),它将 V-JEPA 2.1 视频特征与注视衍生的位置编码一起编码,并产生通过前向钩子注入到选定的 LLM 解码器层的附加残差。可选的第二训练阶段向 LLM 添加低秩适配器 (LoRA),以实现更紧密的集成。在 StreamGaze 基准测试的所有 10 项任务上进行评估后,GazeQwen 的准确率达到 63.9%,比以凝视作为视觉提示的相同 Qwen2.5-VL-7B 主干网高出 16.1 分,比 GPT-4o 多出 10.5 分,这是所有测试的开源和专有模型中得分最高的。这些结果表明,学习在 LLM 中注入注视的位置比缩放模型大小或设计更好的提示更有效。所有代码和检查点均可在 https://github.com/phamtrongthang123/gazeqwen 获取。