论文

用Gemini在真实世界中加速科学研究

Accelerating Scientific Research with Gemini in the Real-World

应用与实践科学研究

摘要

我们介绍Co-Scientist的扩展与全面的真实世界验证。Co-Scientist是一个基于Gemini的多智能体系统,旨在加速从假设生成、实验到论文生成的端到端科学研究。超越计算机内的假设生成,这一专门配置将Co-Scientist转变为以执行为依托的研究伙伴,在材料科学、生物学和计算机科学领域推进闭环科学工作流。在材料科学中,Co-Scientist与半自动化化学气相沉积反应器对接,为MXene设计了一条安全的前驱体路线;实验执行产出了一种层状二维材料,其在关键结构上与Ti3C2Tx MXene晶格相似,但原子结构仍需进一步实验确认。借助Gemini 3 Deep Think实现快速的实验室在环执行,它还能在几分钟内根据实验室约束定制生长配方,实现单层MoS2、MoSe2和WS2半导体的一次尝试即成功生长。在生物学中,Co-Scientist从稀疏的成像数据预测了工程化大肠杆菌在诱导剂(IPTG)梯度上的涌现群体运动表型,与未发表的湿实验形态学测量在数量上吻合。在计算机科学中,Co-Scientist自主发现了一种推理时扩展架构,在HealthBench(Hard和Professional)上超越六个前沿模型,并在盲评医师评估下降低了潜在临床危害。最后,一项由30位领域专家对端到端生成论文进行450份评审的双盲研究表明,Co-Scientist的可靠性模块在提升研究安全性的同时减少了幻觉与抄袭。这些结果共同表明,能够加速真实世界科学发现的闭环多智能体科学AI系统正在取得进展。

用Gemini在真实世界中加速科学研究:论文配图
图1:扩展版 Co-Scientist 架构与科学贡献概览。为弥合计算构思与物理验证之间的鸿沟,我们扩展 Co-Scientist,使其将迭代推理与自主代码执行及实证验证相结合,并使人–AI 协作适配各领域的约束。a–c,Co-Scientist 多智能体架构。a,构思(Ideation):给定研究指令和约束,Co-Scientist 在安全性、新颖性、合理性、可检验性的考量下并受贝叶斯探索指导,探索并完善假设集。b,实验(Experimentation):排名最高的假设被转化为实验计划,系统按该计划生成研究代码,先以最少数据搭建雏形,再扩展到全规模执行。c,论文写作:代码与执行日志被综合成手稿,并进行抄袭检查和论断交叉验证。d,二维材料合成:Co-Scientist 设计安全的 CVD 方案,由人类专家执行并优化,得到与 Ti3​C2​Tx\text{Ti}_{3}\text{C}_{2}\text{T}_{x} MXene 特性相似的二维层状结构(原子层面确认尚待完成),并实现单次尝试即成功生长单层过渡金属二硫属化物(TMD)。e,表型预测:视觉管线预测 E. coli 在 IPTG 梯度(0–10 mM)上的群集(swarming)形态,预测结果与湿实验测量在定量上一致,并正确捕捉到对照菌株中剂量响应的缺失。f,智能体架构发现:在无人工干预的情况下,Co-Scientist 发现了 Agent_H,后者在长度调整后的 HealthBench Hard 与 Professional 上超越前沿模型,并在盲评医生评估下减少临床伤害。g,这些研究覆盖了从人工执行合成(d)、专家–AI 协作(e)到完全自主发现(f)以及端到端手稿生成的连续谱;在端到端手稿生成上,一项双盲研究(30 位专家、450 份评审)表明 Co-Scientist 的可靠性模块减少了严重幻觉和抄袭。