论文

迷失在视觉翻译中:用于脑电图到图像重建的 VLM 辅助感知语义一致性框架

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

模型评测评测方法与指标

摘要

脑电图到图像的评估应区分视觉保真度和可恢复的意义。然而,脑电图衍生的重建是模糊、扭曲和低细节的,导致 SSIM、LPIPS 和 CLIP 惩罚语义上可恢复的输出或奖励看似合理但不正确的输出。我们使用语义探针、图像描述的评价苛刻程度和盲点率以及受控降级分析了来自 ATM、ENIGMA、BrainVis 和 DreamDiffusion 的 6,855 个 真值/重建对。像素指标与语义一致性的相关性接近于零,而表示指标则将感知错误和语义错误混为一谈。因此,我们引入了一个BCI感知框架,其中四个VLM通过结构化问题评估图像对,产生容忍感知对齐分数(T-PAS)和容忍语义对齐分数(T-SAS)。他们的共识被提炼为 BCI 一致性评分 (BCS),这是一个紧凑的评估器,在我们的数据上实现了 0.079 (r = 0.700) 的 T-PAS MAE 和 0.082 (r = 0.850) 的 T-SAS MAE。人类验证显示出高度可靠的联合一致性判断,Cohen 的 kappa = 0.882 +/- 0.174 和 Krippendorff 的 alpha = 0.882,支持感知语义可恢复性优于一般视觉相似性。代码和资源可在 https://sukt03.github.io/BCS/ 获取。