论文
FrontierChallenge:评估科学工作流完成度
FrontierChallenge: Evaluating Scientific Workflow Completion
摘要
科学智能体日益能够分析数据、执行代码并产出研究工件,但大多数基准强调最终答案、孤立程序或单一领域。我们提出FrontierChallenge,一个包含300个端到端科学工作流的跨领域基准。本文发布并评估其中97个任务,涵盖量子化学、分子动力学、材料表征、分析化学、生命科学和电化学/环境。每个任务提供固定输入并规定一组所需的科学交付物。我们用三种agent脚手架评估十二个前沿模型。Pass Rate衡量满足完整完成标准的任务比例,Avg. Score则捕捉部分进展。表现最好的配置也只完成了97个已发布任务中的20个,通过率为20.6%。部分进展在分析化学和电化学/环境领域尤其难以转化为完整交付:平均分分别达到87.6和94.9,但最高通过率仅为4%和0%。在未通过的Claude Code轨迹中,75.5%仍以声称完成的语言收尾。这些发现表明,高部分得分和自信的完成声明都不能可靠表明科学任务已被完整交付,凸显了将端到端工作流执行与科学交付物完整性共同评估的需要。
