论文
用于全双工语音Agent的音频模型评审器可靠性评估
A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents
摘要
研究评估Gemini模型直接根据原始立体声波形给全双工Agent对话评分的可靠性,测试2.5 Flash、3.5 Flash和3.1 Pro。主要证据来自2.5 Flash与三名校准过的人工评审的比较,共209段会话、八个生产评估维度,包括覆盖13种口音及条件的152段对话和57段注入对抗性缺陷的片段。三类检验结果为:八个维度中的五个,模型与人工的Spearman相关系数与人工之间的相关系数相差不超过0.07;七个维度的95%自助法置信区间重叠。六个维度中,60%–92%的会话评分与三人均分相差不超过1分。在48种缺陷与维度组合中的45种,按Newcombe-Wilson 95%置信区间,模型敏感性与人工相当或更好,但多数属于统计检验功效不足的未显著差异,不能视为已证明等效。排名能力可在Gemini家族迁移:3.5 Flash在八个维度均改善简单一致性;3.1 Pro虽有相近排名相关性,多个维度评分却明显低于人工。因此更换模型需重新核验评分校准,不能只看排名相关性。论文指出四类部署注意点,并估算在当前评估频率下,纯人工评审成本约比等量模型评审高两个数量级;证据支持的维度可将模型用作替代或第四评审。