论文

OmniHallu:多模态中跨模态理解和生成的统一幻觉检测 大语言模型

OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

模型评测评测方法与指标

摘要

虽然多模态 大语言模型 (MLLM) 在不同的任务中取得了显着的进展,但它们会产生幻觉,即生成的输出与输入语义相矛盾或歪曲。现有的研究通常解决单一模式或任务类型内的幻觉检测,限制了普遍性。我们推出了 OmniHallu,这是一个统一的幻觉检测框架,涵盖图像、视频和音频模式的理解和生成任务。我们贡献了 OmniHallu-Bench,这是一个包含 10,000 个样本的基准,具有声明级人工注释,涵盖六种跨模式任务:图像到文本 (I2T)、视频到文本 (V2T)、音频到文本 (A2T)、文本到图像 (T2I)、文本到视频 (T2V) 和文本到音频 (T2A)。我们的多代理架构将模型输出分解为原子声明,通过特定模式的专家对其进行验证,并通过结构化推理聚合证据。我们进一步提出了一种偏好优化的可训练验证器,它近似多智能体决策边界,将专家调用减少 66%,同时性能损失最小。大量的实验揭示了一致的模态依赖性性能梯度,并提供了对跨模态幻觉模式的细粒度见解。