论文

定价指导:语言模型能否产生未来的研究想法?

Priced Guidance: Can Language Models Generate Future Research Ideas?

模型评测评测方法与指标

摘要

我们通过压缩的角度评估语言模型产生新颖研究想法的能力。我们的目标是在没有任何提示的情况下,降低语言模型生成未来研究思想本质的潜在微小概率。我们的定价指导框架不是通过昂贵的重复采样来估计这种概率,而是衡量压缩成本:需要多少额外的信息位来指导模型恢复目标想法。我们证明,如果模型能够在预期的最多 K 位指导下恢复目标想法,那么它可以在没有任何指导的情况下以至少 $2^{-K}$ 的概率生成想法。在我们的框架中,称为生成器的语言模型可以提出一系列多项选择问题,并指定可能答案的概率分布。指南是一种能够访问目标想法的语言模型,它会选择答案。如果所选答案具有先验概率 p,则生成器支付 $-\log_2 p$ 位。生成器旨在以最小的累积成本产生与目标想法的本质相匹配的想法。该累积成本等于指南发送的信息位数(最多可达一个附加常数)。利用该方法,我们对最近 87 篇高质量深度学习论文中的核心思想评估了 5 个生成器LLM(Opus 5、Fable 5.1、GPT-6 Astra、GPT-5.6 Sol 和 GLM 5.3),并使用LLM作为判断来确定生成的思想在中心研究对象和定义机制方面是否与目标匹配。 Fable 5.1 实现了最低的中值压缩成本,为 69.9 位,远低于 gzip 无损压缩目标思想摘要的中值 5,712 位。 Fable 5.1、Opus 5 和 Astra 的统一集成进一步将中值压缩成本降低至 55.8 位,并将生成概率下限提高了 18,000 倍。