论文
WASIL:与 LLM 的野外阿拉伯语口语交互
WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
摘要
大语言模型 (LLM) 语音助手通常构建为级联自动语音识别 (ASR) 到 LLM 系统,其中识别错误可能会扭曲用户意图。不喜欢的情况也可能是由于模糊、域外或无请求的转变而产生的,这使得很难隔离 ASR 的影响。我们发布了 WASIL(阿拉伯语中的连接或链接):野外阿拉伯语口语交互提示,包括音频、ASR 假设、助理响应和明确的喜欢/不喜欢反馈(8,529 轮;14.2% 不喜欢),以及涵盖现代标准阿拉伯语 (MSA) 和四种主要方言及其标签的 2,000 轮测试集。我们通过多 ASR 协议指导的后期编辑提供低成本的黄金转录本,并注释可回答性(可回答、模糊/需要澄清、不受支持、非请求/噪音),以将内在的不可回答性与 ASR 引起的退化分开。最后,我们描述了使用多法官 LLM 评分对 ASR 与黄金转录本的响应进行可扩展的无参考评估。