论文
WBench 从五个维度评测交互式视频世界模型
WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
摘要
交互式世界模型快速发展,但现有基准仅覆盖部分必要能力,尚无统一的系统评估标准。我们提出多轮评测基准WBench,从视频质量、设定遵循、交互遵循、一致性及物理规律遵循五个维度评价交互式世界模型。WBench包含289个测试案例、1,058轮交互;每个案例指定世界设定及多轮交互序列,覆盖不同场景、风格、主体、第一和第三人称视角,以及导航、主体动作、事件编辑、视角切换四类交互。导航统一支持文本、六自由度位姿及离散动作控制,可评估原生输入接口不同的模型。22项自动子指标结合专用视觉模型与多模态大语言模型,并全部对照人类判断进行验证。在20个先进模型上的评估发现,没有一个模型在全部维度上都表现出色。我们进一步诊断各模型的优势、弱点及尚待解决的问题。代码与数据见https://github.com/meituan-longcat/WBench。
