论文
VlogReward:为Vlog剪辑学习多维评估
VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing
摘要
Vlog作为一种个性化叙事媒介迅速兴起,催生了对自动化系统来评估和改进Vlog剪辑方案的需求。然而,由于缺乏标准化准则、数据集与基准以及有效的奖励模型,Vlog评估高度主观且仍然充满挑战。为应对这些挑战,我们在专业Vlog创作者和产品经理的指导下定义了一个全面的Vlog评估框架,建立了六个关键维度的分类体系,即创意(Creativity)、一致性(Consistency)、概念设计(Concept Design)、镜头语言(Cinematography)、叙事(Narration)与节奏(Pacing)。随后,我们构建了一个包含10万条Vlog剪辑的大规模数据集和一个专用基准VRMBench,用于评估多模态大语言模型(MLLM)的Vlog奖励能力。最后,我们提出VlogReward,一个稳健的Vlog奖励模型,能够同时提供细粒度的多维评分和可用于迭代改进的可操作反馈。在技术上,我们通过引入可调节的组间比较奖励来增强GRPO(Group Relative Policy Optimization)框架,缓解了标准GRPO的“方向盲”(direction blindness)问题,使模型能更好地区分不同质量的剪辑。VlogReward取得了最先进的结果,显著超越包括GPT-5和Gemini-3-Pro在内的现有MLLM。我们希望这项研究能帮助Vlog创作者,并推动自动化Vlog评估与改进系统的发展。
