论文
用于 VLM 幻觉检测的双词元特征和小-大集合
Two-Token Features and Small-Large Ensembles for VLM Hallucination Detection
摘要
我们展示了用于 SHROOM-Visions 2026 字符级 VLM 幻觉检测共享任务的系统。一个小型($4$B 参数)VLM 被微调为每个词元分类器,从其自己的隐藏状态读取两个词元特征,并在预测时与 $\sim$400B 零样本 VLM 判断器集成。这两个组件都可以查看任何可见图像内文本的现成 OCR。我们使用大型模型生成的合成幻觉数据作为集合多样性的来源,并使用验证来选择特征层、训练数据和 OCR 基础。我们的官方条目在隐藏测试集上达到平均 Cor $0.487$ / Cor-lbl $0.387$,将 $6$th/$28$ (EN)、$6$th/$21$ (FR)、$8$th/$21$ (IT) 和 $7$th/$22$ (ZH) 放在任务的主要 Cor-lbl 指标上。