论文

外星科学:从想法原子中采样连贯但认知上不可用的研究方向

Alien Science: Sampling Coherent but Cognitively Unavailable Research Directions from Idea Atoms

应用与实践科学研究

摘要

大语言模型擅长合成和重新组合熟悉的材料,但它们常常在研究中最重要的特定创造力方面失败:产生对当前社区来说既连贯又不明显的想法。我们通过认知可用性来正式确定这种差距,即典型研究人员根据他们所做的工作自然提出研究方向的可能性。我们引入了一个管道,它(i)将论文分解为粒状概念单元,(ii)将重复出现的单元聚类为想法原子的共享词汇,以及(iii)学习两个互补模型:一个对一组原子是否构成可行方向进行评分的连贯性模型,以及一个对来自社区的研究人员生成该方向的可能性进行评分的可用性模型。然后,我们对在一致性方面得分较高但在可用性方面得分较低的“外星”方向进行抽样。在 NeurIPS、ICLR 和 ICML 的 $\sim$7,500 最近的 LLM 论文的语料库中,我们验证了 (a) 概念单元在重构时保留了论文内容,(b) 思想原子在论文中进行泛化,而不是记住论文特定的措辞,以及 (c) Alien 采样器产生的研究方向比 LLM 基线更加多样化,同时保持了一致性。

科学的异质空间:采样连贯但认知不可及的研究方向
图1:Alien Science Sampling 流水线概览。论文被提炼为概念单元,这些概念单元被聚类成共享的想法原子(idea atoms)词表。连贯性模型(coherence model)学习哪些原子组合能形成可行的研究方向,而可得性模型(availability model)则估计典型研究者会提出哪些组合。外星方向(alien directions)通过最大化连贯性、同时最小化可得性来采样。