论文
模型约会:系统提示中的隐藏日期影响大语言模型评估
Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation
摘要
可重复性对于科学研究至关重要,但之前的工作表明,LLM 的输出随硬件和批处理的不同而变化。我们发现了一个被忽视的因素:当前日期隐藏地注入系统提示中,用户无法控制并且每天都会发生变化。在最近的 9 个大语言模型和 6 个涵盖多项选择 QA (MCQA)、数学推理、代码生成和机器翻译的数据集中,性能仅随当前日期而变化,MCQA 的增量高达 6%,数学推理的增量为 14%,代码生成的增量为 7%,机器翻译的 BLEU 为 2.84。模型排名也会发生变化,影响排行榜。这种日期效应超过了其他非确定性来源,例如批量大小和数值精度。标准的提示技术——思维链和少量提示——不会降低敏感度;思想链甚至放大了它。我们的研究结果强调需要仔细的评估方案,以确保大语言模型研究的可重复性和公平比较。