论文

重复序列揭示了 大语言模型 和自然语言之间的差距

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language

模型评测评测方法与指标

摘要

评估 大语言模型 (LLM) 是否能够捕捉超出本地流利程度的自然语言结构仍然是一个开放的挑战。现有的评估方法主要基于任务绩效或短上下文行为,对生成文本的长期统计组织提供的洞察有限。我们提出了一个基于重复子序列的补充评估框架。通过分析它们在尺度上的分布并将其与高阶 Rényi 熵相关联,我们探讨了文本如何在有限长度条件下重用先前建立的结构。对人类书写文本和长度匹配的 GPT 生成文本的实验表明,虽然幂律模型可以描述块长度的有限范围,但观察到的熵增长通常同样或更好地用对数幂形式来表征。在整个数据集中,自然语言在可访问的范围内表现出稳定的熵增长模式,尽管各个文本之间存在差异,但具有一致的平均行为。相比之下,GPT 生成的文本显示估计指数随模型大小的系统性和统计显着性变化。这些结果表明,重复子序列熵提供了一种定量结构诊断,揭示了远程组织中的系统差异,将自然语言与超越表面流畅性的最先进的 LLM 输出区分开来。