论文

FirstResearch:面向LLM科学发现智能体的可审计问题形成

FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

应用与实践科学研究

摘要

面向科学发现的LLM系统日益辅助构思、文献综合、实验规划与报告生成,但它们提出的首个研究问题仍难审计:可能听起来合理,却不暴露科学家应检查的机制、证伪器或假设。我们引入FirstResearch:面向科学LLM智能体的第一性原理研究问题形成框架——其核心工件是结构化的研究问题证书。证书记录基元定义、假设、机制模型、张力或矛盾、可证伪假说、最小决定性检验与失败更新规则,使所提问题在下游执行前可检查。在十个LLM智能体研究主题上:FirstResearch在主DeepSeek盲裁协议下超越受AI co-scientist、Agent Laboratory与AI Scientist-v2启发的受控提示级基线。Gemini-2.5-Flash独立裁判对同样40个基线包的重评保持系统级排名——FirstResearch得4.86/5对最强基线4.38/5,平均分Pearson一致0.865。单重复消融检查点进一步提示以证书为中心的核心是最强组件:仅证书打分在DeepSeek下达4.90/5、Gemini下达4.88/5,而移除证书在两裁判下都跌破1/5。结果为初步且使用LLM裁判而非人类领域专家,但支持一个窄的科学发现主张:显式推导约束是使LLM生成的科学问题更可审计的有前景机制。代码、提示、输出与复现脚本公开于GitHub。