论文

AgentIdeaBench:Agent时代的科学构思评测

AgentIdeaBench: Benchmarking Scientific Ideation in the Agent Era

智能体系统Agent任务评测

摘要

科学构思是根据科学证据提出新颖且可检验的假设的能力,自主人工智能科学家依赖它。现有的评估主要是通过要求模型从一组静态的、精选的参考论文中产生想法来评估它。这种被动设置背离了现代人工智能科学家的检索和推理工作流程,并且随着模型的改进,它的歧视性变得越来越小。我们引入了 AgentIdeaBench,这是一个多学科基准,可在静态观察和主动探索两种匹配设置下评估科学构思。我们使用多维、经过文献验证的评分框架,对跨越五个学科的 40 个密集评分子领域的 33 名大语言模型进行了匹配的静态-主动评估,该框架的批评者根据检索到的现有技术来评估原创性。主动探索揭示了相当多的能力空间,并且该空间在模型之间分布不均匀。性能扩展速度大约是静态观察下的两倍,并且探索增益是受能力限制的,有利于最强的模型而不是最弱的模型。这一成果反映了更好的基础,提高了可行性、清晰度和特异性,同时在我们的批评下保持了衡量的原创性不变。我们进一步探索科学世界建模,这是一种生成时间循环,通过结构化思维实验完善假设草案。它有利于中等能力模型,而它的影响在似乎已经内化了此类推理模式的前沿模型中会减弱。 AgentIdeaBench 为未来的科学构思工作提供了适合智能体时代的测量基础。