论文

UniEditBench:通过 Distilled MLLM 进行图像和视频编辑的统一且经济高效的基准

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

模型评测基准与评测资源

摘要

可视化编辑模型的评估在方法和模式上仍然分散。现有的基准通常是针对特定范式量身定制的,这使得公平的跨范式比较变得困难,而视频编辑缺乏可靠的评估基准。此外,常见的自动指标通常与人类偏好不一致,但直接部署大型多模态模型(MLLM)作为评估者会产生高昂的计算和财务成本。我们推出了 UniEditBench,这是一个图像和视频编辑的统一基准,支持共享协议下基于重建和指令驱动的方法。 UniEditBench 包括九种图像操作(添加、删除、替换、更改、基于笔画、提取、调整、计数、重新排序)和八种视频操作的结构化分类,涵盖具有挑战性的合成任务,例如计数和空间重新排序。为了实现可扩展的评估,我们将高容量 MLLM 判断器 (Qwen3-VL-235B-A22B Instruct) 提炼为轻量级 4B/8B 评估器,提供结构保真度、文本对齐、背景一致性、自然度和时空一致性(针对视频)的多维评分。实验表明,经过蒸馏的评估器与人类的判断保持了很强的一致性,并且相对于教师模型大大降低了部署成本。 UniEditBench 提供了一个实用且可重复的协议,用于对现代可视化编辑方法进行基准测试。我们的基准和相关奖励模型可在 https://github.com/wesar1/UniEditBench 上公开获取。