论文

Uncheatable Eval:基于动态压缩的语言模型评估

Uncheatable Eval: Dynamic Compression-Based Evaluation of Language Models

模型评测评测方法与指标

摘要

现代大型语言模型是在海量数据集上进行预训练的,因此很难防止基准数据进入其训练集并损害评估结果的可靠性。可靠的评估对于基础模型来说尤其具有挑战性,其有限的指令跟踪能力使基于任务的评估变得复杂。我们引入了 Uncheatable Eval,这是一个动态基准,定期收集新发布的文本来评估基本语言模型并降低数据污染的风险。利用模型的预测能力与其无损压缩数据的能力之间的关系,我们使用压缩率来评估模型预测新文本的效果。我们评估了 14 个文本类别的 80 个模型,研究压缩如何随上下文长度变化,并检查压缩率和零样本 MMLU 准确度之间的相关性。我们的结果得出三个主要发现:(1)压缩性能随模型大小遵循一致的缩放趋势; (2) 基于注意力的模型、混合模型和循环模型的不同之处在于,随着更多上下文的可用,它们的压缩性能如何变化; (3) 较低的压缩率与较高的零样本 MMLU 精度密切相关。代码可从此 https URL 获取。