论文

探索LLM掌握汉语稠象语的能力边界

Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

模型评测基准与评测资源

摘要

虽然大语言模型(LLM)在一般语言任务中取得了显着的成功,但它们在中国互联网语境中具有代表性的亚文化语言丑象语言上的表现仍然很大程度上未被探索。在本文中,我们介绍了 Mouse,这是一个专门的基准测试,旨在评估 LLM 在涉及丑象语言的 NLP 任务上跨六个任务的能力。实验结果表明,当前最先进的(SOTA)LLM 在多个任务上表现出明显的局限性,而在涉及上下文语义理解的任务上表现良好。此外,我们进一步讨论了SOTA LLM在丑象语言上表现普遍较低的原因,检验翻译任务采用的LLM作为法官的方法是否符合人类的判断和价值观,并分析了影响丑象翻译的关键因素。我们的研究旨在促进 NLP 界对多元文化融合和网络语言演变动态的进一步研究。我们的代码和数据是公开的。