论文
Phun-Bench:评估 LLM 的汉语语音理解
Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese
摘要
语言是思想的载体,与声音、符号和意义有着错综复杂的联系。然而,大多数 大语言模型 (LLM) 研究侧重于含义(语义)和符号(拼写),而很大程度上忽视了声音。现有的LLM语音能力基准要么可以通过死记硬背来解决,要么与其他能力交织在一起,使得它们不足以衡量LLM真正的语音理解能力。在这里,我们推出 Phun-Bench,这是一个专门构建的中文基准测试,具有跨三个维度(同音、押韵和语音相似性)的不同任务和设置,旨在系统地评估 LLM 的语音理解。我们的结果表明,虽然 LLM 擅长回忆正确的发音,但它们通常很难以人类说话者灵活、直观的方式利用语音知识。此外,通过详细的分析,我们提出了关于LLM语音理解和“感知”的潜在机制的假设,强调了未来研究尚未探索的前沿。