论文
大语言模型可以接受被操纵的回测吗?清洁控制校准基准
Can LLMs Catch a Rigged Backtest? A Clean-Control Calibration Benchmark
摘要
回测审核是一个校准问题:当模型错误地标记匹配的干净策略时,高缺陷召回率没有用。我们构建了一个包含 96 项的配对基准,其中每个有缺陷的回测都有一个干净的控制,可以在更改一个方法细节的同时固定策略、日期、代码风格、标签和报告框架。确定性评分器将缺陷召回、干净控制误报、证据定位和修复相关性分开。来自四个文本端点的超过 1440 个缓存审核,主要 DeepSeek 审核员达到 100.0% 关闭和干净感知代码召回率,但打开提示过度标记了 93.8% 的干净代码控制,即使召回饱和,清洁感知所有三个特异性也为 87.5%。在召回率不变的情况下,清洁感知警告将 DeepSeek 代码误报率从 20.8\% (95\% CI 11.7--34.3) 降至 0.0\% (0.0--7.4),而预算锚点在相同提示下仍标记 38/48 清洁控制。仅报告召回率就会对这四个模型中的三个进行相同的排名;报告清洁控制率时,他们的差距为 79 分。