论文
SocialOmni:全模态模型视听社交互动能力基准
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
摘要
全模态大语言模型(OLM)通过原生整合音频、视觉与文本,重新定义人机交互。然而,现有 OLM 基准仍锚定于静态的、以准确率为中心的任务,在评估社交互动性——驾驭自然对话中动态线索的根本能力——方面留下关键空白。为此,我们提出 SocialOmni,一个将这种对话互动性评估操作化为三个核心维度的综合基准:(i)说话人分离与识别(谁在说话)、(ii)插话时机控制(何时插入)与(iii)自然插话生成(如何措辞插话)。SocialOmni 包含 2,000 个感知样本以及一个经过质量控制的诊断集——含 209 个受严格时间与上下文约束的交互生成实例,并辅以受控的视听不一致场景来测试模型鲁棒性。我们对 12 个领先 OLM 进行了基准测试,发现各模型社交互动能力差异显著。此外,我们的分析揭示模型的感知准确率与其生成语境恰当插话的能力明显脱钩,表明仅以理解为中心的指标不足以刻画对话社交能力。更令人鼓舞的是,SocialOmni 的这些诊断结果为未来 OLM 弥合感知-互动鸿沟提供了可操作的信号。