论文

谁温暖了档案馆?大语言模型高估了历史的温暖

Who Warmed the Archives? LLMs Overestimate Historical Warmth

模型评测鲁棒性、公平性与可信度评测

摘要

历史档案是一种未充分利用的资源,可用于向后扩展仪器气候记录,而大语言模型提供了一种提取气候学家手工得出的指数的方法。除了测量系统提取该信号的效果之外,我们还检查它们的错误是否可以安全地用于跨世纪比较,因为良好的相关性分数并不能排除系统性的、与时代相关的偏差。比较五个世纪的德语文本中的词汇基线、微调历史Transformer和 LLM 提示的 Pfister 温度指数,词汇方法击败了我们测试的每一个微调Transformer,包括从头开始对历史德语进行预训练的Transformer (r=-0.016)。我们测试的所有六个 LLM(Gemini 2.5 Flash、GPT-5-mini、DeepSeek v4 Flash、Claude Sonnet 4.6、Qwen3.7-Plus、Kimi-K2.6-Fast)都显示出随日历年增长的温暖偏差,每个模型都有相同的迹象(斜率 +0.13 至 +0.34/世纪,p<0.01)。该效应的大小适中(r 平方约等于 0.01 至 0.05),但在六个独立开发的模型中保持一致。六个中相关性最好的 Gemini 2.5 Flash 与最佳词汇相关性 (r=0.32) 的误差加倍。从报价中删除明确的日期和日历时代标记的消融使这一趋势基本上保持不变,与正确推断报价时代的模型相比,更倾向于不合时宜的当前日期。因此,仅凭相关性不足以审查大语言模型作为历史气候指数的预言机。