论文
扮演真正的研究者:评估前沿LLM与智能体的一套基准套件
Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle
摘要
随着基础模型的进步和智能体支架变得越来越复杂,智能体在复杂的长期编码任务甚至自主实验执行方面表现出了卓越的熟练程度。尽管它们从研究助理演变为自主研究Agent,但这些系统在领域敏感性、研究伦理和细致入微的科学判断方面仍然表现出显着的局限性。因此,前沿智能体仍然无法完全取代人类研究人员。为了弥补这一差距,我们概念化了 AARR(作为真正的研究人员)基准测试系列。与主要评估宏观执行能力的现有基准不同,AARR 重点关注智能体是否能够模仿人类研究人员在精细研究场景中的专业性、彻底性和细致入微的推理能力。在这项工作中,我们提出了 AARRI-Bench(充当真正的研究实习生),这是本系列中的第一个基准。我们对前沿模型和代理系统进行了广泛的实验,结果表明,即使是性能最好的配置(带有 Claude Opus 4.7 的 Mini-SWE-Agent)也只能达到 68.3% 的成功率,经常忽略对真正的人类研究人员来说显而易见的微妙但关键的细节。我们的结果表明,开发类似研究人员的人工智能需要进一步探索研究行为,而不仅仅是复杂的脚手架。我们的数据发布于 https://github.com/AARR-bench/AARRI-bench。
