论文

大语言模型 有多像人类?语域感知的语言评估框架

How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework

模型评测评测方法与指标

摘要

虽然事实正确性和任务表现长期以来一直是 大语言模型 (LLM) 研究的焦点,但在语言层面上如何生成类似人类的文本这一基本问题尚未得到充分探索。从语料库语言学的角度来看,语言产生本质上是依赖于语境的,不同的交际语境会导致语言特征的频率和共现模式的差异。不遵守这些模式的文本在内容上可能是正确的,但仍然不利于人类读者。在这项工作中,我们提出了一个上下文感知评估框架,其中使用给定语域的人类参考语料库的语言特征分布和相应的 LLM 生成语料库之间的两个样本问题来评估人类相似度。我们使用最大平均差异(MMD)和 Biber 引入的 67 个词汇语法特征来实现这个框架,这些特征通常应用于语料库语言学。在我们的实验中,我们将跨越不同语域的五个英语数据集的七个指令调整的开源模型与人类基线进行了比较。虽然在所有测试的设置中,LLM 偏离了人类基线,但哪些模型最接近人类语言取决于语域,而不是由模型大小决定。