论文
超越时移:采用 Omni-LLM 作为生成视听模型的无参考评估器
Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
摘要
随着视听生成模型演变成世界模拟器,跨模式同步成为评估生成内容中世界动态和因果关系一致性的关键代理。然而,现有的评估指标假定结构正确,将同步减少为单纯的时间对齐。因此,它们在生成输出上失败,特别是在表现出结构性幻觉和不对称跨模态关系时,目前\textbf{要求专家人工注释来评估同步。}这种依赖性引入了一个关键的悖论:\emph{人类评估者依赖于相对的、依赖参考的比较,而自动化指标需要无参考的、绝对标量。}我们通过提出一个框架来解决这个悖论,该框架将相对的人类感知提炼为连续的、全局一致的指标。首先,我们介绍 SynthSync,这是一个通过成对人类注释排名的生成失败数据集。其次,我们采用配备连续潜在投影的 Omni-LLM,将相对人类排名转换为连续绝对值。第三,我们提出实值组相对策略优化($\mathbb{R}$-GRPO),通过列表分数分布内化同步的全局因果结构。根据经验,我们的指标实现了最先进的人类偏好调整。我们利用这个估计器建立标准化基准,将 AV-Gen 评估从底层信号相关性推进到以视觉证据为依据的因果关系。