论文

MemGuard-Alpha:基于 LLM 的财务预测中检测和过滤记忆污染信号的成员推理的局限性

MemGuard-Alpha: Limits of Membership Inference for Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting

模型评测安全与风险评测

摘要

大语言模型 越来越多地用于生成金融阿尔法信号,但许多人已经记住了训练语料库中的历史数据,产生了明显的准确性,但却超出了样本范围。成员推理攻击(MIA)已被提议作为一种诊断方法。尚未确定的是,MIA 分数是否能提供有关此设置中的记忆的信息,或者一旦应用实际成本,基于它们的信号级过滤是否有帮助。我们引入了 MemGuard-Alpha,包括将五种 MIA 方法与时间邻近特征相结合的复合污染分数,以及跨模型记忆不一致,它利用了跨模型训练截止的变化。然后我们对两者进行审核。在 2019 年至 2024 年的 7 个 LLM (124M-7B)、50 个 S&P 100 成分、42,800 个提示和 299,600 个提示模型 MIA 分数中,出现了三个发现。首先,在样本内状态由训练截止值定义的情况下,时间邻近特征完美地恢复了该标签 (ROC-AUC 1.000),因为它是定义变量的单调变换;任何包含此类特征的综合分数都会报告算术而不是检测的分离。其次,MIA 分数的判别力很大程度上归因于模型之间的尺度差异:在固定日期询问哪些模型在训练中具有该日期,原始分数显得信息量很大(AUC 高达 0.99),但在三个独立的模型内标准化下,判别力下降至 0.487-0.537。第三,在对称应用交易成本的情况下,没有任何过滤变体能够比未过滤的整体提高风险调整后的性能,没有一个获得显着的 Fama-French 五因子 alpha,并且排除单个最弱的模型优于每个基于污染的过滤器。我们将这些结果报告为负面结果以及产生它们的故障模式,并释放重现它们所需的所有工件。