论文

要的是胜任力而非准确率:技能优化中无参考裁判门控的诊断方法

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

模型评测评测方法与指标

摘要

文本空间技能优化通过演化一份自然语言技能文档来适配冻结的智能体,并通过验证门控接受每个候选。现有门控依赖可验证奖励,把这些方法限制在有自动验证器的任务上。用LLM裁判门控替代验证器可以解除这一限制,但这样的门控是否携带可用信号尚未被检验。我们提出一个更前置的问题:在把裁判放入闭环之前,能否判断其分数是否能区分正确与错误答案?我们将无参考裁判形式化为一个潜在求解器——其裁决取决于与自己本会得出的结论是否一致,因此其评估能力受限于其解题能力。该模型给出了以裁判胜任力c与答案空间大小k表示的判别力(ROC-AUC)闭式上界、必要条件c > 1/k,以及如下结果:边际AUC会被题目难度混淆,而题内估计量不会。一个非干预探针在真实优化运行中记录裁判分数而不改变任何决策。我们发现:当胜任力接近下限时判别力等同于随机,高于下限时才可用;裁判的基准准确率会高估真正重要的胜任力;并且在闭环研究中,该筛查能预测会出现哪种门控错误。其结果是一个廉价的裁判门控部署前诊断。

要的是胜任力而非准确率:技能优化中无参考裁判门控的诊断方法:论文配图
图1:(1)验证器门控拥有标准答案,因此只有正确的候选才能通过。(2)无参考裁判没有标准答案,实际上必须重新求解每个条目才能为其评分,因此一旦其能力c接近随机水平下限1/k,其评分就近乎随机。(3)因此我们在部署之前测量能力与区分度,筛选出未能越过该下限的裁判——这是必要条件,但并不充分。