论文
DuplexSpeechBench-IFEval:评估全双工语音智能体的隐式指令遵循
DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents
摘要
全双工语音代理必须不断决定何时监听、反向通道、中断、处理语音重叠、发言和让步。现有的基准测试主要通过显式的回合管理指令来测试这些行为,而部署的代理通常是通过角色或角色进行配置的,必须从中推断出适当的对话行为。我们引入 DuplexSpeechBench-IFEval (DSB-IFEval) 来评估实时语音交互中的隐式指令跟随。 (DSB-IFEval) 包括 1,038 个测试用例,涵盖八种不同的助理角色,并评估五种指令遵循调节协议:默认行为、显式行为指令、角色隐含行为、组合角色-规则调节和指令冲突。我们使用确定性的指令依从性分数 (IAS) 来衡量实时楼层管理,并使用LLM判断的人物依从性分数 (PAS) 来衡量人物角色一致的内容。在六个实时语音系统中,我们发现了依赖于架构的权衡。像 F-Actor 和 PersonaPlex 这样的全双工模型对于对话行为是明确表述还是必须从角色推断更为敏感,在仅角色调节下,依从性分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 强烈遵守角色一致的内容,但它们的底层行为无法适应明确的仅角色指令,并且仍然受到一些主动操作的限制。我们进一步发现,即使系统可靠地遵循与其规定角色相冲突的指令,它们仍然难以在安全冲突下覆盖它们。这些结果表明,推断角色隐含的行为、在适当的对话时刻执行该行为以及解决竞争指令仍然是全双工语音代理面临的独特挑战。
