论文

SKstars参加SHROOM:零样本与LoRA适配视觉-语言模型的一致性引导集成

SKstars at SHROOM: Visions Agreement-Guided Ensembling of Zero-Shot and LoRA-Adapted Vision--Language Models

模型评测评测方法与指标

摘要

本文描述 SKstars 参加SHROOM-Visions 2026的方案,该共享任务针对大视觉-语言模型输出的细粒度幻觉检测。任务要求系统识别幻觉字符跨度、分配幻觉类别并提供预测置信度。我们的方法将 Qwen2.5-VL-72B-Instruct 的零样本预测与 LoRA 适配的 Qwen2.5-VL-7B-Instruct 模型的预测结合,通过轻量集成过程融合两个模型的输出,随后进行跨度精炼和置信度调整。我们在小型内部开发子集上评估主要系统组件,并报告提交系统在官方英文测试集上的性能。SKstars 取得 Cor+Lbl 分数 0.2902,在 29 支队伍中排第 15,Cor 和 IoU 分数分别为 0.3642 和 0.3151,均排第 18。结果表明将大型零样本模型与较小的适配模型结合为多语言细粒度幻觉定位提供了实用框架,同时也凸显了将开发集上的改进迁移到隐藏测试数据的难度。代码与预测已公开。