论文
从评估到增强:视频生成模型的基准测试和改进视频思考推理
From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
摘要
视频生成已取得进步,可以产生视觉上引人注目且时间连贯的结果。然而,这些模型是否能够真正用视频进行思考——执行符号规则、尊重物理定律并追求有意的目标——仍然是一个悬而未决的问题。现有的基准仅部分解决了这个问题,通常将视觉质量与认知正确性混为一谈。我们推出了 VWG-Bench(Video World Generalist Benchmark),这是一个涵盖 9 个推理维度和 38 个细粒度任务的综合基准。为了实现精确诊断,我们设计了一个三级 VLM-as-Judge 协议,该协议独立评估视频级流畅性、任务级规则遵守情况和样本级目标实现情况。对领先模型的评估揭示了一个显着的差距:虽然模型取得了很高的渲染分数,但它们在逻辑繁重和规则约束的任务上始终失败。为了解决这个问题,我们提出了 Vid-PRE(视频提示推理器和增强器),这是一种与模型无关的提示重写器,可以将推理的认知负担减轻到专用的 VLM。 Vid-PRE 通过强化学习和纯粹基于文本的奖励进行训练,可生成简洁的、约束感知的提示,而不会出现视频级奖励信号的不稳定问题。实验表明,Vid-PRE 在多个生成器上产生了显着的推理改进,而无需修改架构。 VWG-Bench 和 Vid-PRE 共同提供了严格的诊断镜头和实现真正的视频思考功能的可扩展路径。所有数据和代码均可在 https://huggingface.co/datasets/KlingTeam/VWG-Bench 上公开获取。