论文

所有泄漏都很重要,有些泄漏更重要:LLM 回测中可解释的时间污染检测

All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection in LLM Backtesting

模型评测评测方法与指标

摘要

为了评估大语言模型是否能够准确预测未来事件,我们需要能够对已经解决的事件进行回测。这要求模型仅根据过去指定日期的可用信息进行推理。然而,大语言模型可能会无意中泄露培训期间编码的截止后知识,从而破坏回顾性评估的有效性。我们引入了一个声明级框架来检测和量化这种\emph{时间知识泄漏}。我们的方法将模型原理分解为原子声明,并通过时间可验证性对它们进行分类,然后应用 \textit{Shapley 值} 来衡量每个声明对预测的贡献。这产生了 \textbf{Shapley} 加权 \textbf{D}ecision-\textbf{C}ritical \textbf{L}eakage \textbf{R}ate (\textbf{Shapley-DCLR}),这是一个可解释的度量,用于捕获决策驱动推理的哪一部分来自泄露的信息。在此框架的基础上,我们提出了 \textbf{Time}-\textbf{S} 监督 \textbf{P}rediction 和 \textbf{E}xtracted \textbf{C}laims (\textbf{TimeSPEC}),它将生成与声明验证和重新生成交织在一起,以主动过滤时间污染 - 生成预测,其中每个支持声明都可以追溯到截止日期之前可用的来源。对涵盖美国最高法院案件预测、NBA 薪资估算和股票回报排名的 350 个实例进行的实验表明,标准提示基线存在严重泄漏。 TimeSPEC 减少了 Shapley-DCLR,同时保留了任务性能,证明了显式的、可解释的声明级验证优于基于提示的时间约束,可实现可靠的回测。

所有泄漏都算数,有些更算数:LLM回测中可解释的时间污染检测与缓解
图1:时间泄露评估流水线概览。给定预测理由R、参考时间t_ref和任务上下文,阶段1提取原子声明{c_i},并依据我们的分类法为每个声明分配类别标签。阶段2和阶段3并行执行:阶段2通过蒙特卡洛采样计算Shapley值{φ_i},量化每个声明对预测的贡献;阶段3使用基于类别的规则确定泄露指示符{ℓ_i}。阶段4将这些输出聚合为两个互补指标:对所有声明一视同仁的总体泄露率(Overall Leakage Rate, OLR),以及按每个声明的预测重要性为泄露加权的Shapley加权决策关键泄露率(Shapley-DCLR)。时间泄露评估流水线概览图。