论文
经动态多轮交互的视觉语言模型情境化评估
Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions
摘要
多模态大语言模型(MLLM)在基准上取得长足进步,但其真实世界效力仍不确定。该差距源于受控静态设定中的基准与真实应用的动态、交互、情境化本质之间的根本错位。为弥合差距,我们提出CEDI(经动态多轮交互的MLLM情境化评估):一个把评估重构为被评模型、自动考官与评分者三方交互的框架。考官在任务图表示引导下进行多轮半结构化对话;经导航状态空间转换,CEDI部署多样策略——从澄清请求到对抗探针——以引出表现证据。我们把CEDI应用于视觉幻觉。跨多模型、多样设定、数据集与领域的实证结果显示:情境化交互评估揭示的幻觉不仅显著多于常规静态评估,且更接近实际用例中出现的幻觉。我们进一步显示幻觉常在长上下文中累积、经自强化对话历史扩散,且模型对需要拒绝前提或拒答的问题尤其脆弱。综合来看,这些发现凸显CEDI是迈向MLLM能力的现实、系统、生态有效评估的一步。代码见github.com/williamium3000/cedi。
