论文

MMBench-Live:持续发展的多模式模型基准

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

模型评测基准与评测资源

摘要

评估基准对于评估视觉语言模型 (VLM) 至关重要,但大多数多模态基准都是静态的,这使得它们容易受到时间陈旧、数据污染和昂贵的维护的影响。我们推出 MMBench-Live,这是一个由多代理驱动的自动化管道构建的不断发展的多模式基准测试。我们的框架将基准演化视为任务引导的数据集构建,集成了结构化基准规范、反馈控制的实时数据采集以及具有可执行推理的可验证的 QA 生成。为了保持跨版本的可比性,我们引入了一种分布一致的更新策略,该策略从原始基准中提取与任务相关的视觉模式来指导数据收集和过滤。 MMBench-Live 由 MMBench 实例化,包含 5900 个新生成的评估实例,答案正确率较高,而每次更新成本约为 30 美元,需要 1-2 小时。广泛的评估表明,MMBench-Live 保留了稳定的模型排名,保持了与原始基准的语义一致性,并表现出较弱的污染相关记忆信号,这为可持续多模式基准演化提供了一种实用且可扩展的范式。该项目可在 https://github.com/PRIS-CV/MMBench-Live 上获取。