论文
SpanCalib-VLM:视觉语言模型中的校准幻觉跨度检测
SpanCalib-VLM: Calibrated Hallucination Span Detection in Vision-Language Models
摘要
在大视觉语言模型 (LVLM) 中检测幻觉需要准确的跨度定位和良好校准的置信度分数。经过微调的生成 VLM 擅长识别幻觉文本范围,但会遭受过度自信和高推理延迟的困扰。判别性序列标记器提供确定性的速度和卓越的校准,但表现出保守的跨度召回。我们提出了 SpanCalib-VLM,这是一种用于 SHROOM-Visions 共享任务的混合双系统,它结合了多模态序列标记器(由通过交叉注意力与 SigLIP 视觉编码器融合的 XLM-RoBERTa-Large 组成)与我们微调的生成 VLM (Qwen3.5-4B-SHROOM-SFT)。通过联合校准融合策略,生成模型中的候选范围将使用序列标记器中的校准概率进行重新评分。在 SHROOM-Visions 英语评估中,我们的集成实现了 0.41 的皮尔逊校准相关性和 0.39 的总体 IoU,干净响应 IoU 为 0.91},总体检测精度为 70.7%。我们公开我们的模型权重和代码。