论文

自己长出来的指标:从评估器自身的盲区演化出评估器

Metrics That Write Themselves: Evolving an Evaluator from Its Own Blind Spots

模型评测AI 基础设施Sandbox评测方法与指标Agent Sandbox

摘要

面对可靠的自动指标,智能体会快速改进,没有则会停滞,而最需要智能体的应用(报告生成即是其一)恰恰是没人知道如何打分的。指标能否自己写出来?说清一个答案好在哪里很难,指出某个答案哪里有问题则更容易,因此我们演化的指标是一个由小型Python算子组成的池:每个算子为候选答案标记一个具名缺陷,或弃权,然后投票。直接让模型给出算子行不通:183个候选只实现了96种不同行为,全部来自一个巨大空间中的狭窄区域。EvalCEGAR转而借用程序验证中的反例引导抽象细化:它把算子池读作一个抽象,并搜索一次碰撞——两个被算子打出相同分数的答案,一个正确一个不正确。这一对答案(而非提示词)就是创作请求;当一次碰撞击败了所有尝试时,循环扩展算子可读取的内容,而不是重新采样。在MBPP+和HumanEval+上(沙盒中隐藏的单元测试提供精确真值),该循环写出了一段55行的算子,在428个未见任务上弥合了"全不标记"与完美过滤器之间15.4%的差距(+0.0065,p=0.0010),而其标记量只有我们最好手写算子的四分之一。在一个它从未见过的基准上,它在三分之一的标记上与该手写算子的效果完全一致。八次运行中有六次产生了这样的算子,且全部六次在样本外有效;而把我们的15个手写算子合并为一个过滤器使用反而损失准确率。基于同样信息打分的LLM裁判在一个几乎不相交的候选集上达到相同增量,但它对每个候选都要永久支付一次模型调用,而算子一次都不用。