论文
预测信用:衡量科学解释对实验预测的贡献
Predictive Credit: Measuring What Scientific Explanations Add to Experimental Forecasts
摘要
科研智能体解释计划中的实验。我们通过共享干预措施、预测者和结果的配对预测来衡量预测信用,同时改变描述、匹配的解释和供体上下文。五项检查跟踪承诺、交付、预测增益、一致性和已知信号的吸收。在受控学习的 336 个预期状态、12 个 Tox21 端点和 24 个 OpenML 任务中,v5 的冻结信用决策尚无定论。 Tox21 的预注册 ROC AUC 区间分数危害测试未满足($D-M=-.0026$,95% 区间 [$-.0174$,.0104]); OpenML 的联合形成、点等价性和可重复性规则未得到满足。与描述相比的匹配点准确度增益仍未得到证实,并且 Tox21/OpenML 种子—供体区间跨越零。根据 DeepSeek V4 Pro 的要求,匹配卡和供体卡将二次 Tox21 漂移分别降低了 64.5% 和 59.1%。 DeepSeek V4 Flash 重播将匹配点 MAE 从 0.01823 提高到 0.02020,并且错过了匹配捐赠者间隔得分等值。 OpenML 全卡分配将名义 80% 的间隔扩大了 21%,覆盖率为 49.3%,而 66/144 卡中的描述和内容覆盖率为 51.4%。直接文本 Flash 提供了所有 144份说明,而没有可检测到的匹配点精度增益。与描述相比,研究人员编写的机制阳性对照将 MAE 点降低了 2.60 个百分点。该协议衡量研究代理基准和科学预测的预测信用;所测试的供体分辨率仍未证实自然解释的可信度。