论文

LLM 回测中的时间泄漏:测量、验证和调整分数

Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

模型评测评测方法与指标

摘要

LLM 回测中污染的标准检查很简单:比较训练截止之前和之后的分数。我们表明此检查没有提供任何信息。四款旗舰机型在无法记住的问题上失败了:每个得分问题在截止后都得到解决。原因是结构性的。模型理所当然地更多地了解接近其截止点的时间,因此新近度模拟了泄漏,并且我们证明没有被动回测可以将两者与真正的技能分开。测量(而不仅仅是检测)需要来自回测之外的信息。我们以两种形式提供。已知的截止值可识别边界处的泄漏;匹配的清洁控制可以全局识别它并产生泄漏调整分数。我们还得出了泄漏隐藏的地方:它集中于让人群感到惊讶的结果,并且在训练中得到了很好的覆盖,而部分记忆会得到不成比例的奖励。我们通过在孪生模型中植入泄漏来根据 真值 验证估计器,在该模型中它们恢复注入的剂量并在干净的问题上返回 null。它们部署在前沿模型上,检测到一个截止本地化签名,并在审计的权力层中清除了五个模型,这些模型的明显优势仅在于新近度。回测不需要被丢弃;他们需要一个有说服力的参考。