论文

AVBench:面向音视频生成模型、与人类判断对齐的自动化评估基准

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

模型评测基准与评测资源

摘要

音视频(AV)生成的快速进展实现了带同步声音的高保真合成,尤其是涉及语音与交互的人物相关场景。然而AV生成的评估仍处于早期阶段,针对人物相关场景的基准寥寥且粗粒度,依赖通用多模态LLM的有限预设评估,导致对模型能力的不准确评估。为解决这些问题,我们提出AVBench,一个专为以人为中心的AV生成设计的全自动基准。AVBench建立在面向全面而准确评估的两个关键设计之上:(一)以人为中心的细粒度指标。AVBench集成了十个面向以人为中心的真实场景的评估维度,涵盖视觉质量、音频质量以及跨模态的多级一致性。这些实用指标捕捉了现有基准常常忽视的人物相关细节。(二)通过偏好学习获得的专业评估器。为解决专业训练数据缺乏的问题,我们通过受控扰动将真实视频转化为多样的训练对,构建大规模监督信号。在这一高质量数据集上微调后,评估器学会可靠地检测细微的跨模态不一致。关键在于,AVBench不产生离散的文本判断,而是从模型对二值决策的预测置信度导出连续评估分数。这种概率化评分机制比传统VQA式评估更可靠,且与人类判断高度一致。总而言之,AVBench为AV生成提供自动化评估,展现出强大的数据筛选潜力,并可作为人类反馈强化学习(RLHF)的可微奖励信号。

AVBench:面向音视频生成模型、与人类判断对齐的自动化评估基准:论文配图
图 1:我们的 AVBench 概述。它集成了多维评估套件,涵盖以人为中心的现实场景的跨模式一致性、音频指标和视频指标,以及包含正常子集和硬子集的分层 AV 提示设计。该框架支持自动化大规模评估和基于人类偏好的对齐验证,以确保可靠的感知对齐。