论文

IndicContextEval:八种印度语言的音频LLM上下文利用评测

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

模型评测基准与评测资源

摘要

AudioLLM 可以根据文本提示(例如域描述或实体列表)进行语音识别。然而,目前尚不清楚这些模型是否真正利用了这种背景,或者依赖于预训练期间学到的参数知识。现有的基准无法回答这个问题,因为它们在固定提示条件下评估转录,并且很少包含明确的上下文输入。我们推出了 IndicContextEval,这是一个针对 8 种印度语言和 23 个专业领域的 555 名说话者进行的 56 小时多语言自然语音基准测试。我们设计了一个 7 级提示框架,逐步引入上下文信号,包括元数据、自然语言描述、英语和母语脚本的实体列表,以及带有错误实体的对抗性提示。评估五个模型揭示了上下文利用行为的显着差异,强调了对 AudioLLM 中的上下文证据利用进行明确评估的必要性。