论文
AIRS-Bench:面向前沿AI研究科学智能体的任务套件
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents
摘要
LLM 智能体在推进科学研究方面具有可观前景。为加速这一进程,我们提出 AIRS-Bench(AI Research Science Benchmark,AI 研究科学基准),一套源自最先进机器学习论文的 20 个任务。这些任务涵盖多样领域,包括语言建模、数学、生物信息学和时间序列预测。AIRS-Bench 任务评估覆盖完整研究生命周期的 Agentic 能力——包括想法生成、实验分析与迭代改进——且不提供基线代码。AIRS-Bench 的任务格式灵活通用,便于集成新任务并在不同 Agentic 框架之间进行严格比较。我们使用前沿模型搭配串行与并行两种脚手架建立基线。结果表明,智能体在四个任务上超越人类 SOTA,但在其余十六个任务上未能企及。即便智能体超越人类基准,它们也未达到底层任务的理论性能上限。这些发现表明 AIRS-Bench 远未饱和,并提供了巨大的改进空间。我们开源 AIRS-Bench 的任务定义与评估代码,以促进自主科学研究的进一步发展。
