论文
基准饱和之后的人生:CORE-Bench案例研究
Life After Benchmark Saturation: A Case Study of CORE-Bench
摘要
当基准的准确率饱和时——它常被退役并被更具挑战性的版本取代。我们表明该做法偏袒准确率——错过研究智能体性能六个其他关键维度的机会:构念效度问题(如捷径)、分布外泛化、效率、可靠性、模型相对脚手架的相对重要性——以及人机协作的提升。我们以CORE-Bench Hard(科学代码计算可复现性基准)为案例——展示即使准确率饱和——沿这些维度测量智能体也能产生有意义的洞见。第一——我们在CORE-Bench Hard中发现难以用较弱智能体预见的构念效度威胁。我们引入改进的基准CORE-Bench v1.1与分布外任务套件CORE-Bench OOD。第二——我们发现尽管准确率饱和——CORE-Bench v1.1在测量效率、可靠性、模型性能与脚手架性能上仍然有用。最后——我们开展小规模随机化实验测量真实计算可复现任务上人机协作的提升。我们发现统计显著的约两倍加速——可能被低估(因为五分之一仅人类复现未完成即到时)——并描述其他发现。合起来——我们的贡献给出对主流以准确率为中心评估范式的更严格替代。