论文

日常知识并不简单:多语言大模型的知识问答失败

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

模型评测基准与评测资源

摘要

知识问答房间、问答夜和节目挑战从标准事实到日常文化的广泛知识。论文以常见与小众主题的问答题检验大模型竞争力,提出多语言 TriviaRoomQA,覆盖 288 个主题的日常、文化与长尾知识。基准包含六种欧洲语言的 3300 组平行选择题,以及用于细粒度案例研究的另 5340 道法语题。研究评估欧洲、亚洲和北美厂商的三十种权重开放模型,参数为 7B–70B。模型在历史、地理与数学等知识密集主题上较强,却在明星、音乐、电影与新闻等日常流行文化上明显较弱。同一底层问题的成绩也随语言变化,说明事实知识访问并非总与语言无关。结果揭示了既有趋于饱和的学术基准未充分捕获的知识缺口。