论文

财经新闻 NLP 中的时间泄漏:具有特定政权并购信号的多架构审计

Temporal Leakage in Financial News NLP: A Multi-Architecture Audit with a Regime-Specific M&A Signal

模型评测鲁棒性、公平性与可信度评测

摘要

财经新闻方向预测已成为流行的 NLP 基准,但报告的收益主要取决于训练-测试分割是按时间顺序还是随机,即时间泄漏。我们对跨 16 个特征模型组合(涵盖 TF-IDF、MiniLM、FinBERT 和微调 RoBERTa-large / DeBERTa-v3-large,以及 Llama-3 和 Qwen2.5 LLM 的单独零/少样本和 LoRA 探针)的 49,799 篇文章语料库的这种依赖性进行审核:随机分割使 MCC 膨胀 1.1 美元\times$ $6.5\times$,跟踪模型容量和功能丰富度,端到端 FinBERT 微调 重新放大而不是缩小差距(尺寸匹配比率 $1.75\times$)。以事件类型为条件,并购 (M&A) 是唯一在近时间时间顺序评估下具有正锁定测试信号的审计类别(TF-IDF MCC $= 0.138$ 仅训练,$0.068$ 在训练$\cup$val 改装下;10,000 排列 $p < 10^{-3}$);该信号不会传输到 FNSPID 的 2009-2020 年美国语料库,将标题本地化为 2024-2025 年欧洲倾斜的并购语义,而不是通用预测器。三个独立的角色贴标签者将收购者标签的文章作为信号轨迹进行聚合,这是一种功率有限的定性聚合,而不是经过假设检验的不对称性。按时间顺序的分割对于金融 NLP 的作用就像特征清除对于资产定价的作用一样:它剥离了新闻中可预测的、过时的部分,留下了较小的、事件本地化的、词汇浅薄的残差。我们主张将泄漏审计作为财务 NLP 基准的必要披露。