论文

BrainFocus:EEG 引导的 ROI 选择以实现高效的视觉语言模型

BrainFocus: EEG-Guided ROI Selection for Efficient Vision-Language Models

上下文与知识上下文工程

摘要

视觉语言模型 (VLM) 实现了强大的视觉问答 (VQA) 性能,但当只有一个小区域相关时,处理大型杂乱图像的计算成本很高。脑电图 (EEG) 信号可捕获人类神经对视觉刺激的反应,可以提供有关感兴趣区域 (ROI) 的人类衍生语义线索。然而,脑电图引导的视觉类别解码仍然不完善,使得直接 ROI 路由不可靠。在这项工作中,我们提出了 BrainFocus,一种可靠的 EEG 引导的高效 VLM 框架,用于 VQA。 EEG 分类器预测目标类别,YOLO 检测器定位匹配的 ROI。仅当两个预测都通过置信度阈值时,VLM 才会接收裁剪后的 ROI;否则,它会处理完整图像。为了进行评估,我们在 EEG-ImageNet 的基础上构建了一个 40 类基准,包括生成的杂乱图像和真实的以对象为中心的图像,以及目标 ROI 注释和 600 个英语视觉问答对。在 Qwen3.5-VL 2B、4B 和 9B 模型中,BrainFocus 将杂乱场景下的 VQA 准确度提高了 4.14-9.87 个百分点 (pp),同时将输入标记和总标记减少了 23.2%-39.4% 和 23.2%-39.3%,并将端到端浮点运算 (FLOP) 减少了23.2%-39.5%。这些结果表明,即使 EEG 的语义解码不完善,也可以指导有效的 VLM 推理。