论文
Science Edge Evaluation(SEE):迈向真实科学发现缺失的一步
Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery
摘要
大语言模型(LLM)越来越多地参与科学发现,但它们能否支持复杂的真实实验室科学仍不清楚。我们提出Science Edge Evaluation(SEE),一个多模态基准,其问题由专家策划,根植于化学、生物学和材料科学经同行评审的文献与实验实践。对19个多模态大语言模型(MLLM)的评估显示,即使表现最好的模型也仅达到48.7%的准确率;而且平均而言,通用模型优于科学专用模型。在视觉Agent评估中,工具使用将最佳准确率提升到52.7%。工具使用可以扩大模型可获得的信息,但更多信息并不必然带来可靠的科学推理。关键挑战在于模型能否在原始实验证据的边界内管理工具获得的信息。综合来看,这些发现表明当前MLLM仍无法可靠地基于实验结果做出有依据的、以证据为界的推断,而这正是真实科学发现中的一项基本能力。弥合这一差距,需要MLLM从解释既定科学概念转向从实验数据中推导新颖的、基于证据的洞见。
