论文

VākQA:泰卢固语口语事实问答的基准和评估研究

VākQA: A Benchmark and Evaluation Study for Telugu Spoken Factoid Question Answering

模型评测基准与评测资源

摘要

大型语言模型的问答技术发展迅速,但主要针对文本和口语环境中的高资源语言。泰卢固语的口语问答 (SQA) 基准尚未探索,并且在此设置中自动评估的可靠性仍未量化。我们推出了 VākQA,这是一个泰卢固语 SQA 基准,涵盖六个领域的 2,001 个事实问答对,包含 2.53 小时的语音音频、双语转录和人工验证的参考答案。我们首先根据人类判断验证评估方法:双子座法官最接近人类评分,但不是一律严格,而开放权重法官系统地惩罚表面形式与参考不同的正确泰卢固语答案。使用这个经过验证的设置,我们跨输入模式、语言和领域对专有和开放权重模型进行基准测试。我们观察到泰卢固语措辞保留了翻译中丢失的文化特异性,语音输入引入了改变问题含义的语音混乱,并且级联的 ASR-MT 错误逐渐复合。 VākQA 已公开发布。