论文
合规性、能力和冲突:系统消息下的多模式 LLM 基准测试
Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages
摘要
多模式 大语言模型 (MLLM) 的生产部署越来越依赖系统消息来管理模型行为。然而,现有的基准要么仅评估文本中的约束,要么将它们嵌入到用户回合中,从而在很大程度上无法衡量多模式环境中的系统消息遵守情况;他们还对合规性是否以牺牲基础视觉语言能力为代价持开放态度。我们引入了 VSysBench,这是一个基于 MMVet-v2 构建的基准,它将约束分为 5 个主要类别和 22 个子类别,范围从视觉上下文中的文本指令到完全基于视觉的指令,每个类别都与一个对教学层次结构进行压力测试的未对齐对应项配对。 VSysBench 通过联合满意度 (JSR) 和交叉约束敏感度 (CCS) 沿约束合规性和答案正确性这两个轴对每个响应进行联合评分。在 16 个 MLLM 中,我们发现强加系统消息会严重损害基本任务的准确性,开放权重模型的合规性会在用户冲突下崩溃,而顶级专有模型的合规性则保持稳定,并且基于视觉的约束是每个模型最难的类别。