论文
DCP:分数之外,核验AI研究智能体是否真正取得发现
Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
摘要
AI研究智能体结合先验知识、公开来源和实验反馈产生结果。发现认证协议DCP把结果主张变为可执行的复现与反馈检验。第一关在封闭评测中核验有用改进。第二关向匹配的智能体提供登记的初始信息和已观察网络内容,但不给目标研究历史;任何达到数值目标的有效替代方法都是复现见证,触发Core否决。DCP Core要求充分对照、未观察到替代复现,并给出一次新登记试验中复现概率的有限样本界。可选第三关从同一检查点比较真实反馈与指定中性策略的平均作用;DCP Evidence在独立零效应校准和登记效应阈值后纳入该作用。不同模型下的SQLite优化与虚拟催化剂控制两项受控核验运行完整协议,各在96次试验中无复现,概率上界0.0468;配对研究各有30次真实反馈复现、零次中性反馈复现,并通过60对零效应检验。其他案例演示Core、已复现及核验不完整的判定。无语言模型的确定性验证器可从冻结证据重现判断。协议为有用结果、替代路径和反馈作用提供共同证据表述。