论文

学习通过多模式事件流看穿极端照明 大语言模型

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

模型训练监督微调与指令调优

摘要

多模态 大语言模型 (MLLM) 在标准条件下执行强大的视觉语言推理,但在极端照明下会失败,此时 RGB 输入会丢失不可撤销的结构和语义。我们提出了 Event-MLLM,这是一种事件增强模型,通过动态地将事件流与 RGB 帧融合来执行全光视觉推理。两个关键组件推动了我们的方法:照明指示器(从 DINOv2 分支派生的可学习信号,代表曝光退化并自适应调制事件 RGB 融合)和照明校正损失,将融合特征与潜在空间中的未退化(正常光)语义对齐,补偿极端照明中丢失的信息。我们为 MLLM 策划了第一个多照明事件指令语料库,其中包含跨不同场景的 2,241 个事件 RGB 样本(每个样本约 6 个 QA 对)和 17 个亮度率(0.05x - 20x),以及用于在极端照明下进行推理、计数和细粒度识别的指令跟踪基准。实验表明,Event-MLLM 的性能明显优于通用、光照自适应和仅事件基线,在具有挑战性的光照下,在稳健的多模态感知和推理方面树立了新的技术水平。