论文
分层跨模式融合可以预测人类对人工智能配音内容的感知吗?
Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?
摘要
评估人工智能生成的配音内容本质上是多维的,由同步性、可理解性、说话者一致性、情感一致性和语义上下文决定。人类平均意见评分 (MOS) 仍然是黄金标准,但规模化成本高昂且不切实际。我们提出了一种分层多模态架构,用于感知有意义的配音评估,集成了来自音频、视频和文本的补充线索。该模型捕获细粒度的特征,例如说话者身份、韵律和音频内容、视频中的面部表情和场景级线索以及文本中的语义上下文,这些特征通过模内和模间层逐步融合。轻量级 LoRA 适配器可实现跨模式的参数高效 微调。为了克服有限的主观标签,我们通过聚合客观指标和通过主动学习优化的权重来导出代理 MOS。所提出的架构在 12k 印地语-英语双向配音剪辑上进行训练,然后使用人类 MOS 进行 微调 训练。我们的方法实现了强大的感知一致性(PCC > 0.75),为自动评估人工智能配音内容提供了可扩展的解决方案。