论文
大语言模型真的比人类更聪明吗?
Are Large Language Models Truly Smarter Than Humans?
摘要
公开排行榜日益显示,大语言模型(LLM)在涵盖学术知识、法律和编程的基准上超越人类专家。然而大多数基准完全公开,其题目在互联网上被广泛转载,带来了模型恰好在评估所用数据上接受过训练的系统性风险。本文通过三个互补实验,对GPT-4o、GPT-4o-mini、DeepSeek-R1、DeepSeek-V3、Llama-3.3-70B和Qwen3-235B这六个前沿LLM开展了严格的多方法污染审计。实验1将词汇层面的污染检测流水线应用于覆盖全部57个学科的513道MMLU题目,发现总体污染率为13.8%(STEM为18.1%,哲学高达66.7%),且按类别估计的性能增益为+0.030至+0.054个准确率点。实验2对100道MMLU题目施加改写与间接引用诊断,发现间接引用下准确率平均下降7.0个百分点,法律与伦理学科更是高达19.8个百分点。实验3对全部513道题目和全部六个模型施加TS-Guessing行为探针,发现72.5%的情况触发了远高于随机水平的记忆信号,其中DeepSeek-R1呈现分布式记忆特征(76.6%部分重构、0%逐字复现),这解释了它在实验2中的异常表现。三个实验均收敛于同一污染程度排序:STEM > Professional > Social Sciences > Humanities。
