论文

多模态统一幻觉模糊测试 大语言模型

Unified Hallucination Fuzzing for Multimodal Large Language Models

模型评测评测方法与指标

摘要

幻觉仍然是多模式 大语言模型 (MLLM) 的一个持续挑战,严重限制了它们在高风险应用中的可靠性。现有的评估主要基于静态基准,存在分类覆盖范围窄和性能快速饱和的问题,无法反映模型在不断变化的现实场景中的稳健性。为了弥补这一差距,我们提出了一个系统的评估框架,将综合基准与自我演进的压力测试相结合。首先,我们介绍 UniHall,这是一个基于跨越对象、指令和知识维度的统一分类法的细粒度数据集。其次,为了解决基准饱和问题,我们提出了自适应多模态模糊测试(SAMF),这是一种自适应框架,采用进化变异策略来探索模型幻觉的边界。至关重要的是,为了确保动态输入的可靠评估,SAMF 整合了由多模式预言机集合驱动的结构化指标套件。我们的大量实验表明,与传统设置相比,最先进的 MLLM 在模糊测试下表现出显着的性能下降,暴露了推理能力和事实基础之间的脱节。此外,我们还发现了一种帮助与幻觉的权衡,即强化学习的调整无意中加剧了对指令执行任务的阿谀奉承。框架、代码和基准可在 https://github.com/LanceZPF/EvalHall 获取。