论文

NumLeak:公共数值基准作为基础模型中的潜在标签

NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

模型评测评测方法与指标

摘要

公共数字基准出现在预训练中,因此对日期条件的评估可能是衡量记忆的回忆,而不是样本外的技能。我们引入了 NumLeak,这是一个测量框架,它将生产模型上的 API 边界探测与开放因果 LM 上的白盒控制验证相结合。顶级前沿 LLM 回顾 Fama-French 市场超额回报,3 种子池 Pearson r=0.97-0.99,同时在五个同级因子上保持在 25 个基点内的 0.15 以内;美国失业率、CPI 通胀和 NOAA 气温也具有类似的保真度。在最近发布的坚持中,解析率下降到 21-57%,但在回答的月份中,r 保持在大约 0.99,这是记忆通道预测的拒绝或召回不对称性。白盒实验再现了剂量反应,logprob 排名检测了开放式生成错过的记忆,这意味着封闭 API 黑盒探针低估了通道。一旦模型自身的召回率被残差掉,与 r=0.74 处的真实 Mkt-RF 相关的 Sonnet“市场情绪日期”回归就会崩溃至 r=0.02。单行系统提示防御可阻止 99.8% 的非自适应单轮后缀攻击,在概念和历史叙述查询上的效用成本接近于零