论文

口语函数调用:大型音频语言模型口语理解的新视角

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

模型评测基准与评测资源

摘要

口语理解(SLU)是面向任务的对话系统的核心组成部分,也是实现人机无缝交互的关键环节。虽然传统的 SLU 可以在域内监督 微调 之后有效地提取封闭集任务的用户语义,但由于其模糊的规则定义,在利用上下文学习进行开放域任务方面面临着重大挑战。这项工作提出了口语函数调用(SFC),这是一种新颖的语义理解视角,它通过结构化规则定义来优化语义理解,以超越传统的封闭集 SLU。具体来说,我们基于传统的SLU数据集策划和扩展了一套语音功能,构建了一个多智能体系统来综合SFC-Bench数据集,评估大语言模型(LLM)和大型音频语言模型(LALM)的性能,并通过后训练增强LALM的SFC功能。实验表明,SFC 优于传统 SLU,大大提高了 LLM 和 LALM 的语义提取精度。