论文
COMPOSITE-Stem
摘要
AI智能体在加速科学发现方面的前景与日俱增;然而,前沿评测的缺失阻碍了其被采纳进真实工作流。专家撰写的基准已被证明能有效度量AI推理,但其中大多数在此阶段已经饱和,且仅度量受限输出上的性能。为帮助弥合这一缺口,我们提出COMPOSITE-STEM,一个涵盖物理、生物、化学与数学领域70道专家撰写任务的基准,由博士级研究者策划。我们的基准将精确匹配评分与基于标准的量规相结合,并采用LLM评审团(LLM-as-a-jury)评分协议,从而能够更灵活地评估具有科学意义的输出。我们在Harbor智能体评估框架内使用适配后的多模态Terminus-2智能体工具链,评估了四个前沿模型。表现最佳的模型取得21%的成绩,表明COMPOSITE-STEM所考察的能力超出了当前智能体的触及范围。经贡献者许可,所有任务均已开源,以支持可复现性,并推动AI加速这些领域科学进步的后续研究。
