论文
硅基官僚制与AI应试教育:LLM基准中的污染敏感性与分数置信度
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
摘要
公开基准越来越多地支配着大语言模型(LLM)的排名、选择与部署方式。我们将这种以基准为中心的体制概括为“硅基官僚制与AI应试教育”(Silicon Bureaucracy and AI Test-Oriented Education),并论证它建立在一个脆弱的假设之上:基准分数直接反映真实的泛化能力。然而在实践中,这类分数可能将应试能力与系统性能力混为一谈,尤其是在现代训练流程中难以排除污染(contamination)与语义泄漏的情况下。因此,我们提出了一个用于分析LLM基准中污染敏感性与分数置信度的审计框架。利用路由器-工作者(router-worker)设置,我们将干净对照条件与噪声条件进行比较,后者在将基准题目传递到下游之前对其进行系统性的删除、改写与扰动。对于一个真正干净的基准,噪声条件不应持续优于干净对照基线。然而在多个模型上,我们发现噪声条件下普遍存在异质性的超越基线的增益,这表明与基准相关的线索可能被重新组装,并能重新激活与污染相关的记忆。这些结果表明,相似的基准分数可能带有截然不同的置信水平。我们不主张全盘否定基准,而是认为基于基准的评估应当辅以对污染敏感性与分数置信度的显式审计。
