论文
Blind-Spots-Bench:评估多模态模型的盲点
Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
摘要
现代AI模型在许多既有基准上表现强劲,但仍在人类觉得几乎平凡的任务上失败——如操作字符串或画一只五条腿的狗。这些示例提示既有基准可能低估了当前系统的持续盲点。我们引入Blind-Spots-Bench:经对人类简单但现代AI仍具挑战的任务暴露此类盲点的基准。我们从AI课程的学生收集原始问题、清洗并以结构化参考解标注、针对235样本的结果数据集提出任务分类;进一步开发自动评分管线评估广泛模型——包括开放权重与闭源的语言、视觉语言与图像生成模型。分析揭示:闭源前沿模型可大幅超越开放权重模型(差距约10%),即便它们在既有基准上表现相当。更细的分析显示没有单一模型在所有任务类型上占优,且部分任务对所有受评模型仍具挑战。结果凸显该基准作为识别当前模型具体弱点的诊断压力测试的价值。
