论文
迈向自动研究:从具有分类结构的纸质知识图中挖掘可证伪的研究思想
Toward Auto-Research: Mining Falsifiable Research Ideas from Paper Knowledge Graphs with Categorical Structure
摘要
基于 大语言模型 (LLM) 构建的自动研究想法生成系统有一个结构性弱点:它们将想法简化为自由文本重组、随机论文配对或嵌入相似性检索。这三种方法都以同样的方式失败:每种方法都将论文视为平面对象、字符串或向量,因此商去除了研究人员在推理跨领域类比时实际使用的类型化问题-方法-度量-声明箭头。我们用类型图本身无法提供的最小范畴论部分来恢复丢失的结构:组合以及恒等箭头,这使得可以询问所提出的类比是否保留了关系链。具体来说,每篇论文 $p$ 都被建模为一个小类别 $C_p$,其对象是提取的类型化研究实体,其态射是论文断言的关系;从 $p$ 到 $q$ 的跨纸桥是一个部分函子候选 $F: C_p -> C_q$ ,它保留对象类型和覆盖的关系类。我们将该模型实例化为三层算法:分类签名聚类、函子保留门和六轴 LLM 合理性判断。在四种消融条件下对数万篇全文解析论文的语料库进行评估,分类门以大约 17:1 的比例过滤跨域候选者,而接受的想法的定量伪造率始终保持在 83% 以上;每个被拒绝的候选者都会保留其每轴的基本原理,因此门可以兼作日志层而不是静默过滤器。