所有泄漏都很重要,有些泄漏更重要:LLM 回测中可解释的时间污染检测
All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection in LLM Backtesting
摘要
为了评估大语言模型是否能够准确预测未来事件,我们需要能够对已经解决的事件进行回测。这要求模型仅根据过去指定日期的可用信息进行推理。然而,大语言模型可能会无意中泄露培训期间编码的截止后知识,从而破坏回顾性评估的有效性。我们引入了一个声明级框架来检测和量化这种\emph{时间知识泄漏}。我们的方法将模型原理分解为原子声明,并通过时间可验证性对它们进行分类,然后应用 \textit{Shapley 值} 来衡量每个声明对预测的贡献。这产生了 \textbf{Shapley} 加权 \textbf{D}ecision-\textbf{C}ritical \textbf{L}eakage \textbf{R}ate (\textbf{Shapley-DCLR}),这是一个可解释的度量,用于捕获决策驱动推理的哪一部分来自泄露的信息。在此框架的基础上,我们提出了 \textbf{Time}-\textbf{S} 监督 \textbf{P}rediction 和 \textbf{E}xtracted \textbf{C}laims (\textbf{TimeSPEC}),它将生成与声明验证和重新生成交织在一起,以主动过滤时间污染 - 生成预测,其中每个支持声明都可以追溯到截止日期之前可用的来源。对涵盖美国最高法院案件预测、NBA 薪资估算和股票回报排名的 350 个实例进行的实验表明,标准提示基线存在严重泄漏。 TimeSPEC 减少了 Shapley-DCLR,同时保留了任务性能,证明了显式的、可解释的声明级验证优于基于提示的时间约束,可实现可靠的回测。
