论文
Look-Ahead-Bench:面向金融时点LLM前瞻偏差的标准化基准
Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance
摘要
我们提出 Look-Ahead-Bench,一个在真实且实用的金融工作流中测量时点(PiT)大语言模型(LLM)前瞻偏差的标准化基准。与主要经由问答测试内在前瞻知识的大多数现有方法不同,我们的基准评估模型在实践场景中的行为。为区分真实预测能力与基于记忆的表现,我们分析跨时间上不同市场体制的性能衰减,并纳入若干定量基线以建立性能阈值。我们评估知名开源 LLM——Llama 3.1(8B 与 70B)与 DeepSeek 3.2——以及来自 PiT-Inference 的一族时点 LLM(Pitinf-Small、Pitinf-Medium 与前沿级模型 Pitinf-Large)。结果显示,以 alpha 衰减衡量,标准 LLM 存在显著前瞻偏差,而 Pitinf 模型则随规模扩大展现更强的泛化与推理能力。本工作为金融 LLM 时间偏差的标准化评估奠定基础,并为识别适合真实部署的模型提供实用框架。代码见 GitHub:https://github.com/benstaf/lookaheadbench