论文

DuplexSpeechBench-IFEval:评估全双工语音智能体的隐式指令遵循

DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

智能体系统Agent任务评测

摘要

全双工语音代理必须不断决定何时监听、反向通道、中断、处理语音重叠、发言和让步。现有的基准测试主要通过显式的回合管理指令来测试这些行为,而部署的代理通常是通过角色或角色进行配置的,必须从中推断出适当的对话行为。我们引入 DuplexSpeechBench-IFEval (DSB-IFEval) 来评估实时语音交互中的隐式指令跟随。 (DSB-IFEval) 包括 1,038 个测试用例,涵盖八种不同的助理角色,并评估五种指令遵循调节协议:默认行为、显式行为指令、角色隐含行为、组合角色-规则调节和指令冲突。我们使用确定性的指令依从性分数 (IAS) 来衡量实时楼层管理,并使用LLM判断的人物依从性分数 (PAS) 来衡量人物角色一致的内容。在六个实时语音系统中,我们发现了依赖于架构的权衡。像 F-Actor 和 PersonaPlex 这样的全双工模型对于对话行为是明确表述还是必须从角色推断更为敏感,在仅角色调节下,依从性分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 强烈遵守角色一致的内容,但它们的底层行为无法适应明确的仅角色指令,并且仍然受到一些主动操作的限制。我们进一步发现,即使系统可靠地遵循与其规定角色相冲突的指令,它们仍然难以在安全冲突下覆盖它们。这些结果表明,推断角色隐含的行为、在适当的对话时刻执行该行为以及解决竞争指令仍然是全双工语音代理面临的独特挑战。

DuplexSpeechBench-IFEval:评估全双工语音智能体的隐式指令遵循:论文配图
图1:双面话语-IFEval(DSB-IFEval)为实时语音智能体提供用户方的口语互动和不同的指令/个人调节,并通过五项补充协议评估明确的指示、人为干扰的行为以及教学冲突。