论文

SGHA:基于本地语言模型的有证据支持的研究问题发现

SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models

应用与实践科学研究

摘要

近期面向全自动化AI科学家的努力表明,语言模型Agent能够生成假设、执行实验并撰写科学手稿。然而,在研究早期——即研究问题被表述的阶段——这些AI科学家往往严重依赖专有前沿模型。它们提出的方案受不透明的参数化知识塑造,文献检索又以方案本身为条件。这类知识实际上是黑箱,这种依赖使所生成研究问题的证据基础与有效性难以审计,也让整个过程易受特定模型幻觉与偏见的影响。此外,如果专有研究材料被传输到外部API,使用这些模型会带来保密性、隐私和数据治理方面的顾虑。我们介绍结构缺口假设Agent(SGHA),一个完全自动化、以语料为先的研究问题发现系统,完全运行在本地LLM上。SGHA把科学文献语料结构化为证据链接的论文对象和类型化证据图,跨论文检测未解决的结构模式,在表述之前筛选候选缺口,并产出可追溯的研究问题族。特别地,它能够输出假设、目标、成功标准和遗留的模糊点。SGHA所有基于LLM的组件都由本地部署的开权重9B语言模型执行,无需专有前沿模型API。我们在五个机器学习领域将SGHA与AI Scientist-v2的想法生成模块进行比较。结果表明,显式的语料结构和证据约束推理可以在生成与验证阶段都不依赖前沿模型的情况下,支持有前景、可检查的研究问题表述。

SGHA:基于本地语言模型的证据接地式研究问题发现:论文配图
图1:SGHA 流程概览。“确定性”指非 LLM 阶段。演化分支是可选的,并与经验证门控的家族输出分开报告。演化操作迭代多次并馈入问题合成阶段。