论文
EvalResearchBench:AI 智能体可以设计自己的评估吗?
EvalResearchBench: Can AI Agents Design Their Own Evaluations?
摘要
递归自我改进 (RSI) 依靠评估反馈来评估进展并指导进一步的研究,但重复运行复杂的基准测试成本高昂且会减慢迭代速度。人类专家通过选择基准子集或设计紧凑套件来降低成本。我们询问AI 智能体是否可以自动化这个设计过程,并引入EvalResearchBench(ERB),这是一个自主评估研究的基准。给定目标材料、开发参考、候选 API 以及固定时间和 API 预算,称为研究人员的智能体会选择或综合任务,实施评分器,并在试点测试中对其进行修改,然后冻结用于编码、协作和推理的可执行评估器。我们研究了 9 位研究人员和 13 个候选模型,并将每个冻结的评估者与 14 个目标基准的分数一致性和成对一致性进行比较。最好的评估者按照目标对大约 75% 的候选对进行排序,低于目标之间的分歧所设定的 91% 上限。没有研究人员在每一个指标上都处于领先地位,并且开发目标的最佳评估者也不是研究人员隐藏的密封目标的最佳评估者。人工设计的公共任务样本仍然是强有力的基线,记录执行成本最低的评估者获得最高的成对协议。 智能体通过试点反馈修复任务和评分者,但评估者仍然可以截断答案、耗尽评估预算,或者让几个问题主导领域分数。
