论文
AutoSciBench:用于评估科学智能体的自主基准生成
AutoSciBench: Autonomous Benchmark Generation for Evaluating Scientific Agents
摘要
随着智能体的快速发展,现有基准可能会变得饱和,从而限制了它们区分功能和揭示剩余故障模式的能力。特别是在科学领域,构建和更新基准需要大量时间、劳动力和领域专业知识,因此很难使评估与智能体功能的进步保持一致。我们通过研究科学的智能体基准是否可以随着智能体功能的发展自动生成和迭代调整来应对这一挑战。我们引入了 AutoSciBench,这是一个框架,它将每个任务表示为指定科学领域、数据模态和所需推理方法的高级概念,以及指定如何构建和验证问题、环境和真实答案的低级配方。 智能体尝试解决每个任务,产生求解器轨迹和相应的判断反馈,AutoSciBench 使用这些反馈来修改方案或概念,关闭观察到的捷径,并将任务转向原始数据重新检查、中间结果解释和证据整合。从已完成的细化轨迹中提取的经验进一步指导新概念的生成,从而从早期任务细化中吸取经验教训,为后续的基准构建提供信息。我们从现有基准出发,跨计算生物学、材料科学和临床成像评估 AutoSciBench。相对于计算生物学和材料科学中人工策划的基准,生成的基准分别将平均求解器精度降低了 22.4 和 25.5 个百分点,而生成的任务在所有三个领域获得了更高的平均质量评级,这表明科学智能体评估可以随着智能体能力的进步而适应。
