论文
通过预注册下一个 LLM 缓解基于 LLM 的 p-Hacking
Mitigating LLM-based p-Hacking by Preregistering for the Next LLM
摘要
大语言模型 (LLM) 越来越多地用于生成、分类和注释数据,其输出馈送到下游假设检验。然而,基于 LLM 的研究很容易被破解:研究人员可以调整提示、解码参数或输出格式,直到达到所需的结果。我们提出了一种协议来减轻基于 LLM 的研究中的 p-hacking:预注册实验和合格的模型,然后在预注册后发布的第一个合格的 LLM 上运行它。研究人员敲定当前模型的程序,将分析计划与一组符合条件的未来模型一起预先注册,并对随后发布的第一个符合条件的模型进行验证性分析。由于该模型在承诺时不存在,因此无法被黑客攻击;此外,经常破解一个模型的配置不会转移到下一个模型。我们在两个真实值已知的任务上评估该协议。在来自四个提供商的 20 个模型和 11 个 LLM 分析配置中,该协议在两项任务中分别有 73.9% 和 72.7% 的情况阻止了 p-hack 的成功传输。其他分析表明,在多次压力测试下,缓解措施仍然很显着。最后,我们言出必行,遵循自己的协议并预先注册了我们的实验。预注册的实验证实了该协议的有效性:在对先前模型进行攻击的 7 种配置中,在随后发布的第一个符合条件的模型上,有 6 种配置的攻击失败了。