论文
一次运行不是一个想法:自动化研究中的实施彩票
One Run Is Not an Idea: The Implementation Lottery in Automated Research
摘要
自动化研究系统使用实验分数来提供工件并决定保留、转移和追求哪些想法。然而,一次运行就能实现一个想法。将实现级别得分视为有关父机制的证据会创建\emph{实现抽签},其中想法级别的结论取决于对哪个看似合理的实现进行了采样。每当一次运行更新了对某种机制的信念时,这种不匹配就是结构性的。我们估计它的大小。 \emph{想法可靠性审计}通过验证和冻结候选卡、对新会话实施进行采样、使用结果无关的保真度标签以及重新运行保存的工件来测量 \emph{想法可靠性}。它报告了创意 ICC 和留一实施 (LOO) 获胜者逆转。先前的工作通常会重复该任务;我们重复这个想法。在 13 个表格任务和两种编码代理设置的 312 项分配中,实现方差分别超过相同工件重新运行方差的五倍和十倍,并且一次实现抽签的获胜者与其他两项均值下的获胜者的决策差异为 25.6% 和 43.6%。在两种结果盲审规则下,逆转可以通过卡级过滤。使用确定性评估器对三种材料回归工作流程进行探索性诊断,还发现实现变化主导了分解。这些发现将创意的可靠性与最佳的 N$ 工件实用性区分开来。在分数指导想法级分支、转移或研究记忆之前,证据应该涵盖多种实现。