论文

$S^3$-Bench:将语音交互模型评估为科学语音助手

$S^3$-Bench: Evaluating Speech Interaction Models as Scientific Voice Assistants

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的进步从根本上重塑了人机交互的范式,特别是能够无缝对话的语音交互模型。尽管作为通用语音助手表现出色,但它们在专业领域的表现仍未得到充分探索,特别是在科学领域。科学互动带来了巨大的挑战,包括罕见的技术术语、缩写的口语规范以及符号特殊表达的自然语言表达。在本文中,我们介绍了S$^3$-Bench,这是一个涵盖10个主要学科的系统评估框架,由用于语音问答的知识集和用于与模拟用户代理进行多轮渐进交互的对话集组成。通过将完整的原子转换分解为语音识别、感知、推理知识利用和响应发音等阶段,我们系统地描述了现有方法的常见挑战和性能权衡。此外,多轮交互实验揭示了用户适应和准确、全面、高效响应生成的持续局限性。