论文

实时语音 AI 听到但不听

Real-Time Voice AI Hears but Does Not Listen

模型评测模型能力评测

摘要

语音通过言语和声音传递信息。我们评估了四种领先的生产实时语音系统 - OpenAI 的 GPT Realtime 2、Google 的 Gemini 3.1 Flash Live 以及阿里巴巴的 Qwen3.5 Omni Plus 和 Omni Flash-on 任务,其中单词和交付模式都传达有意义的信息。在三个相应的场景中,所有四个系统都根据单词而不是声音起作用。他们会结束哭泣的来电者的通话,这些来电者坚称没有任何问题,批准以惊恐的声音授权的电汇,并登记同意明显带有讽刺意味的来电者。令人惊讶的是,这通常并不是感知失败。当直接询问时,四个系统中的三个可以可靠地识别出他们后来在做出决定时忽略的痛苦、恐惧或讽刺。当这些实时语音系统估计口音和年龄时,我们观察到类似的模式,因为它们的反应经常遵循单词的偏差,而不是说话者的声学特性。我们将感知和行动之间的这种脱节称为语音人工智能的情商差距。提示系统明确关注声音传递只能部分且不一致地提高性能。我们的研究结果表明,当前的实时语音人工智能系统通常表现得好像语音已被简化为转录本,这表明在语气和情感传达重要信息的环境中应谨慎使用它们。