论文

诱导无奖励评判准则以降低智能体评估中的过度记分

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

对语言模型智能体的大规模评估越来越依赖第二个语言模型作为自动评判器,因为金标准信号——可执行的环境奖励——在部署时往往昂贵、缓慢或不可得。这样的评判器是一个无奖励代理,其价值取决于它是否可信,然而现有评判器要么手工编写评分准则(如G-Eval),要么微调评判器的权重,两者都容易把流畅但不成功的轨迹记为成功。我们转而从一小组带真值标注的轨迹中诱导出智能体评判准则的文本,将其锚定在真实结果上。我们提出RubricForge,它通过针对标注轨迹的反思式进化来演化评判准则,以最大化与环境奖励的一致性,随后将其冻结,并在单次模型调用中对留出轨迹应用该准则,无需访问环境。优化得到的产物是人类可读的文本,因此每一次判定都可归因于具名的准则。使用同一个冻结的7B模型同时充当智能体和评判器,在tau-bench(从220次rollout中抽取173条标注轨迹)和WebShop(160条)上,主要收益在于忠实性而非原始一致性。相对通用G-Eval评判器的优势在统计上不显著(McNemar p = 0.248),绝对分数校准还略微偏向通用评判器(|err|差值-0.048,p = 2x10^-4)。然而,RubricForge对失败轨迹的过度记分频率约为一半(tau-bench上假通过率0.115对0.173,三次过度记分捕获、零次翻转),并且对WebShop分级结果的排序更忠实(Spearman 0.410对0.370)。对一个无奖励评估器而言,假通过率而非总体一致性才是与部署相关的量,因为假通过会让损坏的智能体上线,而假失败只会损失一次重试。