论文
不止能说的:面向前问题科学构思的基准与框架
More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation
摘要
人工智能研究代理在自动化文献检索和手稿精炼方面表现出了强大的潜力,但大多数都假设有一个清晰且可操作的初始输入,只有在研究问题明确后才进行操作。相比之下,人类的研究往往始于默契的摩擦,即在形成问题之前的一种不一致感。我们引入了 InciteResearch,这是一个多智能体框架,旨在使研究人员的隐性理解变得明确、可检查和可操作。 InciteResearch 分解了苏格拉底式提问的逻辑链,并将其分布在整个管道中:(1) 引出一个结构化的五维研究人员档案状态,该状态由模糊的、甚至与领域无关的输入中的特定摩擦点锚定; (2) 通过执行 7 阶段因果推导追踪来最大化可行性-新颖性产品,从而违反隐藏假设; (3) 检查所提出的方法是否是重构见解的必然结果。我们进一步介绍了 TF-Bench,这是第一个从隐性到显式研究协助的基准,它可以区分四种科学模式中与领域相关的灵感和与领域无关的灵感。在 TF-Bench 上,InciteResearch 在基于提示的基线上取得了跨越式的进步(新颖性/影响力从 3.671/3.806 到 4.250/4.397),将生成的提案从重组转变为架构洞察。我们的工作表明,人工智能可以作为思维本身的延伸,而不仅仅是自动化下游执行。
