论文

大语言模型真的比人类更聪明吗?

Are Large Language Models Truly Smarter Than Humans?

模型评测鲁棒性、公平性与可信度评测

摘要

公开排行榜日益显示,大语言模型(LLM)在涵盖学术知识、法律和编程的基准上超越人类专家。然而大多数基准完全公开,其题目在互联网上被广泛转载,带来了模型恰好在评估所用数据上接受过训练的系统性风险。本文通过三个互补实验,对GPT-4o、GPT-4o-mini、DeepSeek-R1、DeepSeek-V3、Llama-3.3-70B和Qwen3-235B这六个前沿LLM开展了严格的多方法污染审计。实验1将词汇层面的污染检测流水线应用于覆盖全部57个学科的513道MMLU题目,发现总体污染率为13.8%(STEM为18.1%,哲学高达66.7%),且按类别估计的性能增益为+0.030至+0.054个准确率点。实验2对100道MMLU题目施加改写与间接引用诊断,发现间接引用下准确率平均下降7.0个百分点,法律与伦理学科更是高达19.8个百分点。实验3对全部513道题目和全部六个模型施加TS-Guessing行为探针,发现72.5%的情况触发了远高于随机水平的记忆信号,其中DeepSeek-R1呈现分布式记忆特征(76.6%部分重构、0%逐字复现),这解释了它在实验2中的异常表现。三个实验均收敛于同一污染程度排序:STEM > Professional > Social Sciences > Humanities。

大语言模型真的比人类更聪明吗?:论文配图
图 1:实验 2 结果(所有六个模型)。左:按问题形式和模型划分的准确性。蓝色=原始,橙色=释义,红色=间接引用。由于表面形式与训练文本不同,大多数模型的准确性都会下降; DeepSeek-R1 是实验 3 解释的一个显着异常(低基线,最小下降)。右:所有六个模型中受试者的平均准确度下降(原始→\到间接)。法律 (−-0.20) 和道德 (−-0.20) 下降幅度最大,直接对应于专业和人文类别中实验 1 的最高污染率。