论文
LLM-as-Judge 框架,用于评估视觉语言模型中音调诱发的幻觉
LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models
摘要
视觉语言模型(VLM)越来越多地部署在可靠的视觉基础带来操作后果的环境中,但它们在逐渐强制的提示措辞下的行为仍然没有得到充分表征。现有的幻觉基准主要依赖于中性提示和二元检测,而幻觉的发生率和强度如何对结构不同的任务类型中的分级语言压力做出反应仍是未知数。我们提出了 Ghost-100,这是一个程序构建的基准,由 800 张合成生成的图像组成,涵盖三个任务系列的八个类别:文本难以辨认、时间阅读和对象不存在,每个类别都根据否定 真值 原则设计,保证查询的目标不存在、难以辨认或通过构建不确定。每张图像都与来自结构化 5 级提示强度框架的五个提示配对,保持图像和任务身份固定,同时仅改变指令力,以便将语气隔离为唯一的自变量。我们采用双轨评估协议:基于规则的 H-Rate 测量模型从有根据的拒绝转变为无支持的积极承诺的响应比例,以及 GPT-4o-mini-judged H-Score 的 1-5 等级,描述制造一旦发生的置信度和特异性。我们还发布了一个三阶段自动验证工作流程,可回顾性地确认 800 张图像中的 717 张严格合规。通过评估九个开放权重 VLM,我们发现 H-Rate 和 H-Score 在各个模型系列中显着分离,阅读风格和存在检测子集以不同的方式响应即时压力,并且一些模型表现出在中间模糊音调水平达到峰值的非单调敏感性:聚合指标的模式。