论文
LLM 中毒圣杯评测报告
The Poisoned Chalice of LLM Evaluation Report
摘要
大语言模型 越来越多地用于评估和支持软件工程任务,但这些评估的有效性常常因预训练期间是否看到基准实例的不确定性而受到损害。这可能会导致数据污染,从而可能会提高性能并导致有关模型功能的误导性结论。尽管如此,许多现代模型的训练语料库仅部分公开,使得直接净化不可行。这就需要一种实用的方法来检测 大语言模型 之前接触过的训练数据,而无需访问完整的训练语料库。为了应对这一挑战,我们组织了第一届 LLM 中毒圣杯评估竞赛,与 FSE-AIWare 2026 竞赛赛道同地举办。该竞赛将污染检测定义为源代码上的白盒成员推理任务,并为参与者提供精心策划的数据集、目标模型、基线攻击以及对保留模型和数据集的最终评估。这种设计鼓励超越表面数据集工件和单一训练设置的泛化方法。本文报告了比赛的设置和结果。更广泛地说,该竞赛旨在围绕值得信赖的软件工程 LLM 评估来促进社区发展。